Streaming zamiany tekstu na mowę
Streaming zamiany tekstu na mowę
Ten przewodnik pokazuje, jak przesyłać strumieniowo zamianę tekstu na mowę i opcjonalnie przesłać audio do AWS S3.
Ten przewodnik przedstawia trzy podejścia: generowanie mowy jako pliku, bezpośrednie streamowanie odpowiedzi audio oraz opcjonalne przesyłanie wygenerowanego audio do koszyka AWS S3, aby udostępniać je przez podpisany URL.
Ten przewodnik zakłada, że masz już skonfigurowany klucz API i SDK. Jeśli jeszcze tego nie zrobiono, najpierw ukończ szybki start. Opcjonalna sekcja przesyłania do S3 wymaga też konta AWS z dostępem do S3.
Chcesz wiedzieć, dlaczego streaming działa w ten sposób? Jak działa streaming audio szczegółowo wyjaśnia protokół, buforowanie i kompromisy związane z opóźnieniami.
Zamiana tekstu na mowę (plik)
Aby zamienić tekst na mowę i zapisać go jako plik, użyjemy metody convert z SDK ElevenLabs, a następnie zapiszemy wynik lokalnie jako plik .mp3.
Następnie uruchom tę funkcję tak:
Zamiana tekstu na mowę (streaming)
Jeśli wolisz streamować audio bezpośrednio bez zapisywania go do pliku, możesz użyć funkcji streamingu.
Następnie uruchom tę funkcję tak:
Dodatkowo — przesyłanie do AWS S3 i uzyskiwanie bezpiecznego linku do udostępniania
Gdy dane audio zostaną utworzone jako plik lub strumień, możesz chcieć udostępnić je użytkownikom. Możesz w tym celu przesłać je do koszyka AWS S3 i wygenerować bezpieczny link do udostępniania.
Tworzenie poświadczeń AWS
Aby przesłać dane do S3, musisz dodać identyfikator klucza dostępu AWS, tajny klucz dostępu i nazwę regionu AWS do pliku .env. Aby znaleźć te poświadczenia, wykonaj te kroki:
- Zaloguj się do konsoli AWS Management Console: przejdź na stronę główną AWS i zaloguj się na swoje konto.

- Otwórz panel IAM (Identity and Access Management): IAM znajdziesz w menu usług w sekcji „Security, Identity, & Compliance”. Panel IAM pozwala bezpiecznie zarządzać dostępem do usług AWS.

- Utwórz nowego użytkownika (jeśli to konieczne): w panelu IAM wybierz „Users”, a następnie „Add user”. Wpisz nazwę użytkownika.

- Ustaw uprawnienia: przypisz zasady bezpośrednio do użytkownika, zależnie od poziomu dostępu, który chcesz przyznać. Do przesyłania plików do S3 możesz użyć zasady AmazonS3FullAccess. Najlepiej jednak stosować zasadę najmniejszych uprawnień, czyli przyznawać tylko minimalne uprawnienia potrzebne do wykonania zadania. Możesz utworzyć własną zasadę, która zezwala tylko na niezbędne działania w koszyku S3.

- Sprawdź ustawienia i utwórz użytkownika: sprawdź ustawienia i utwórz użytkownika. Po utworzeniu zobaczysz identyfikator klucza dostępu i tajny klucz dostępu. Pobierz je i bezpiecznie zapisz; po tym kroku nie będzie można ponownie uzyskać tajnego klucza dostępu.

- Pobierz nazwę regionu AWS, np. us-east-1

Jeśli nie masz koszyka AWS S3, utwórz nowy, wykonując te kroki:
- Otwórz panel S3: S3 znajdziesz w menu usług w sekcji „Storage”.

- Utwórz nowy koszyk: w panelu S3 kliknij przycisk „Create bucket”.

- Wpisz nazwę koszyka i kliknij przycisk „Create bucket”. Pozostałe opcje koszyka możesz zostawić domyślne. Nowy koszyk pojawi się na liście.


Instalowanie AWS SDK i dodawanie poświadczeń
Zainstaluj boto3, aby korzystać z usług AWS przez pip i npm.
Następnie dodaj zmienne środowiskowe do pliku .env:
Przesyłanie do AWS S3 i generowanie podpisanego URL-a
Dodaj poniższe funkcje, aby przesłać strumień audio do S3 i wygenerować podpisany URL.
Możesz teraz wywołać funkcję przesyłania ze strumieniem audio utworzonym z tekstu.
Po przesłaniu pliku audio do S3 wygeneruj podpisany URL, aby udostępnić dostęp do pliku. Ten URL będzie ograniczony czasowo, czyli wygaśnie po określonym czasie, dzięki czemu nadaje się do tymczasowego udostępniania.
Teraz możesz wygenerować URL z pliku:
Jeśli chcesz używać pliku wiele razy, zapisz ścieżkę pliku S3 w bazie danych, a następnie generuj podpisany URL za każdym razem, gdy go potrzebujesz. Nie zapisuj bezpośrednio podpisanego URL-a, ponieważ wygaśnie.
Łączenie wszystkiego
Aby połączyć wszystko w całość, użyj poniższego skryptu:
Podsumowanie
Wiesz już, jak zamieniać tekst na mowę i generować podpisany URL do udostępniania pliku audio. Ta funkcja daje wiele możliwości dynamicznego tworzenia i udostępniania treści.
Oto kilka przykładów tego, co możesz dzięki niej zbudować.
-
Podcasty edukacyjne: twórz spersonalizowane treści edukacyjne dostępne dla uczniów na żądanie. Nauczyciele mogą zamieniać lekcje na format audio, przesyłać je do S3 i udostępniać uczniom linki, aby nauka poza tradycyjną klasą była ciekawsza.
-
Funkcje dostępności na stronach internetowych: zwiększ dostępność strony, oferując treści tekstowe w formacie audio. Dzięki temu informacje na stronach będą bardziej dostępne dla osób z wadami wzroku lub tych, które wolą uczyć się ze słuchu.
-
Automatyczne wiadomości obsługi klienta: twórz automatyczne i spersonalizowane wiadomości audio dla obsługi klienta, np. odpowiedzi na najczęstsze pytania lub aktualizacje zamówień. Może to zapewnić ciekawsze doświadczenie niż tradycyjne e-maile tekstowe.
-
Audiobooki i narracja: zamieniaj całe książki lub opowiadania na format audio, oferując odbiorcom nowy sposób na kontakt z literaturą. Autorzy i wydawcy mogą poszerzać ofertę treści i docierać do osób, które wolą słuchać niż czytać.
-
Narzędzia do nauki języków: twórz materiały do nauki języków, które oferują uczącym się lekcje i ćwiczenia audio. Umożliwia to ukierunkowane ćwiczenie wymowy i rozumienia ze słuchu.