Wykrywanie encji
Ten przewodnik pokazuje, jak używać wykrywania encji z API Speech to Text.
Przewodnik krok po kroku · Zakłada, że masz za sobą krótki przewodnik po Speech to Text .
Omówienie
Wykrywanie encji to funkcja, która pozwala wykrywać w transkrypcji konkretne słowa i wyrażenia oraz podaje ich dokładne znaczniki czasu. Przydaje się do wykrywania numerów kart kredytowych, imion i nazwisk, schorzeń czy numerów ubezpieczenia społecznego, które można potem zredagować.
Po włączeniu model wykrywa określone typy encji w transkrypcji i podaje ich dokładne znaczniki czasu.
Na przykład poniższe audio:
Zwraca poniższą transkrypcję, gdy określimy "pii" (dane umożliwiające identyfikację osoby) jako typ encji:
Wynik pokazuje encje PII wykryte w transkrypcji wraz z ich dokładnymi znacznikami czasu.
Integracja wykrywania encji
Wykrywanie encji jest zintegrowane z API Speech to Text przez przekazanie parametru entity_detection do metody convert.
Typy encji
Obsługujemy wykrywanie poniższych typów encji. Możesz wykrywać całe grupy za pomocą słów kluczowych kategorii pii, phi, pci, other lub offensive_language, albo wskazać pojedyncze typy encji według etykiety. Aby wykryć wszystkie typy encji, użyj kategorii all.
PII (dane umożliwiające identyfikację osoby)
PHI (chronione informacje o zdrowiu)
PCI (branża kart płatniczych)
Inne encje
Obraźliwy język
Redagowanie encji
Oprócz wykrywania encji możesz usuwać je z tekstu transkrypcji za pomocą parametru
entity_redaction. Przyjmuje on ten sam format co entity_detection: all,
słowo kluczowe kategorii lub listę konkretnych typów encji. Typy do usunięcia muszą być podzbiorem
wykrytych typów.
Gdy redagowanie jest włączone, dopasowany tekst encji zostaje zastąpiony znacznikiem zarówno w
tekście transkrypcji, jak i w danych na poziomie słów, a pole entities nie jest zwracane w
odpowiedzi.
Parametr entity_redaction_mode określa format znacznika:
Wykrywanie i redagowanie encji nie jest obsługiwane przy stylu wyjścia wielokanałowego combined.