Od głosu do tekstu
Usługa rozpoznawania mowy przekształca wypowiedź w tekst. Jej konfiguracja musi odpowiadać językowi rozmowy. Nazwy firm, nazwiska, hałas i przerywanie zdań to ważne przypadki testowe.
Od pytania do odpowiedzi
Model otrzymuje instrukcje, kontekst rozmowy i zatwierdzone informacje. Na tej podstawie przygotowuje odpowiedź lub proponuje użycie narzędzia. Jakość zależy od zakresu wiedzy, zasad oraz dostępnych integracji.
Narzędzia wykonują działania
Sprawdzenie kalendarza i zapis wizyty powinny odbywać się przez uwierzytelnione narzędzia. Backend weryfikuje dane i uprawnienia. Asystent powinien potwierdzić wykonanie dopiero po otrzymaniu poprawnego wyniku.
Od tekstu do naturalnego głosu
Synteza mowy odczytuje odpowiedź. Wybrany głos, długość zdań, tempo i obsługa przerwań wpływają na odbiór rozmowy. Dobra konfiguracja języka nie zastępuje odsłuchu rzeczywistych scenariuszy.
Całość wymaga obsługi wyjątków
Sprawdź brak dostępności, niezrozumiane nazwisko, rozłączenie i niedziałającą integrację. Użytkownik powinien otrzymać zrozumiałą informację oraz drogę do zespołu. Działający asystent to cały proces, nie tylko model i głos.