Search

Home

TEXT RECOGNIZE

TEXT RECOGNIZE

Operator TEXT RECOGNIZE służy do rozpoznawania i standaryzacji wartości tekstowych na podstawie zewnętrznego lub automatycznie generowanego słownika. Jego głównym celem jest eliminacja różnych wariantów tej samej wartości, które mogą pojawić się w danych wejściowych w wyniku błędów ludzkich, różnic językowych, stosowania skrótów, literówek lub niejednolitego nazewnictwa.

Działanie operatora polega na:

  • porównaniu wartości wybranego bitu tekstowego ze słownikiem referencyjnym,
  • odnalezieniu najbardziej prawdopodobnej wartości ze słownika w przypadku braku dokładnego dopasowania,
  • zastąpieniu oryginalnej wartości wartością ustandaryzowaną.

Operator wykorzystuje słownik uniwersalny, który może zostać:

  • zdefiniowany przez użytkownika, np. poprzez wskazanie tabeli z mapowaniem wartości,
  • zbudowany automatycznie na podstawie analizy częstości występowania wartości w danych, co pozwala wykrywać wartości dominujące i tworzyć słownik dynamicznie.

Operator TEXT RECOGNIZE jest szczególnie przydatny w projektach, w których dane pochodzą z różnych systemów, źródeł lub są wprowadzane ręcznie, wszędzie tam, gdzie istotne jest zapewnienie spójności wartości tekstowych i ograniczenie błędów interpretacyjnych.

Przykład projektu GRAVITY z użyciem operatora TEXT RECOGNIZE.

image

KONFIGURACJA OPERATORA

Podczas konfiguracji wskazujesz kolumnę podlegającą rozpoznawaniu oraz wybierasz wariant działania operatora.

image

Jeżeli wybierzesz wariant Standardized with dictionary, musisz dodatkowo wskazać zbiór danych przekazanych do operatora END OF PATH (pole Temporary output), zawierający słownik uniwersalny, oraz kolumnę (Temporary output column) zawierającą wartości odpowiadające analizowanej kolumnie.

Jeżeli wybierzesz wariant Standardized without dictionary, słownik zostanie zbudowany automatycznie na podstawie wartości występujących w wybranej kolumnie. Wartość tekstowa występująca w kolumnie więcej niż trzy razy zostanie dodana do tworzonego słownika.