Dust dodaje wielojęzyczny głos do opartych na AI procesów pracy w firmach dzięki ElevenLabs
- Opublikowano
PosłuchajPosłuchaj tego artykułu
Dust, system operacyjny dla firm stawiających na AI, oferuje teraz wielojęzyczne wejście i wyjście głosowe — dzięki ElevenLabs. Dust integruje modele z codzienną pracą, dlatego potrzebował funkcji głosowych działających w różnych językach, na różnych urządzeniach i w różnych sytuacjach — z niskim opóźnieniem i wysokim realizmem.
To nie był eksperyment. Głos stał się priorytetem produktu po licznych prośbach klientów. Efekt: system wspierający bezdotykową interakcję z agentami w drodze do pracy, wielojęzyczną współpracę globalnych zespołów i profesjonalne audio do asynchronicznych procesów pracy.
Dlaczego głos ma znaczenie w firmie
Dust wskazał cztery kluczowe wymagania wobec głosu w pracy:
- Naturalna jakość, która wytrzymuje krytyczną ocenę: Głos musi brzmieć profesjonalnie i po ludzku — tak, by nadawał się do udostępniania w e-mailach do klientów, podcastach czy prezentacjach produktu.
- Wielojęzyczność domyślnie: Zespoły działają w biurach na całym świecie i w wielu językach. Przełączanie między francuskim, angielskim i niemieckim w jednej sesji nie powinno być wyjątkiem.
- Niskie opóźnienie: Zarówno przy wejściu, jak i wyjściu szybkość odpowiedzi musi dorównywać tempu myślenia i rozmowy.
- Obsługa danych na poziomie firmowym: Brak przechowywania danych, routing według regionu oraz zgodność z SOC2 i RODO były niezbędne.
Dlaczego Dust wybrał ElevenLabs
Po ocenie dostawców, w tym OpenAI, Google, Deepgram i AssemblyAI, Dust wybrał ElevenLabs ze względu na wyższą jakość i gotowość do wdrożenia:
- Text to Speech zapewniał stale wysoki realizm i szeroki zakres emocji — kluczowe dla narzędzi Speech Generator i Sound Studio firmy Dust.
- Speech to Text obsługiwał transkrypcję w 99 językach z wysoką dokładnością między językami.
- Zero Data Retention i routing między regionami zapewniały zgodność firmową od razu po wdrożeniu.
- SDK i API gotowe do produkcji umożliwiły szybką integrację i stałą wydajność na różnych platformach.
Jak Dust zintegrował głos
Dust dodał obsługę głosu do dwóch głównych workflow:
1. Wejście głosowe: rozmowa z agentami
Dzięki modelowi scribe_v1 od ElevenLabs użytkownicy mogą teraz rozmawiać z agentami przez mikrofon. System automatycznie wykrywa język mówiony, transkrybuje go i odpowiednio kieruje prośbę, rozpoznając nawet nazwy agentów z naturalnej mowy.
Wejście głosowe jest dostępne na urządzeniach mobilnych — wtedy, gdy pisanie jest najmniej wygodne.
2. Wyjście głosowe: audio generowane przez agentów
Dzięki Speech Generator agenci Dust mogą tworzyć treści audio z modelami ElevenLabs eleven_multilingual_v2 i eleven_v3. Obejmują one podcasty, briefingi i narracyjne materiały audio — do użytku wewnętrznego i udostępniania na zewnątrz.
Sound Studio, wspierane przez Text to Sound Effects, dodaje niewerbalne warstwy audio do szkoleń i tworzenia treści.
Czego nauczył się Dust
- Routing regionalny ma znaczenie: Wybór regionu UE/USA skrócił opóźnienia i ułatwił rozmowy o zgodności.
- Selekcja jest lepsza niż nadmiar: Starannie dobrany zestaw 12 głosów ogranicza zmęczenie wyborem, a zarazem pokrywa wszystkie kluczowe potrzeby.
- Jakość > szybkość: Mimo dostępności szybszych modeli użytkownicy konsekwentnie wybierali głosy o wyższej jakości do treści produkcyjnych.
Co to umożliwia
- Produktywność z myślą o urządzeniach mobilnych: Zapisuj myśli i współpracuj w ruchu.
- Wielojęzyczna współpraca: Mów naturalnie w swoim języku — agenci zajmą się resztą.
Dostępne, asynchroniczne workflow: Zamieniaj wyniki badań w audio, obniżaj bariery wejścia i wspieraj różne style pracy.
Co dalej
Dust bada możliwości konwersacyjnych agentów głosowych działających w czasie rzeczywistym, głębszego rozumienia audio poza transkrypcją oraz obsługi długich materiałów, takich jak spotkania i prezentacje. Integrując ElevenLabs, Dust sprawia, że głos staje się naturalną częścią AI dla firm.




