Modele

Dowiedz się, jak wybrać odpowiedni model do swojego zastosowania

ElevenAgents zapewnia jeden interfejs do łączenia agenta z wieloma modelami i dostawcami, dając elastyczność, niezawodność i optymalizację kosztów.

Kluczowe funkcje

  • Jednolity dostęp: Przełączaj dostawców i modele przy minimalnych zmianach w kodzie
  • Wysoka niezawodność: Automatycznie przechodź do kolejnego dostawcy, gdy jeden zawiedzie
  • Monitorowanie wydatków: Śledź wydatki na różne modele

Obsługiwane modele

Obecnie poniższe modele są obsługiwane natywnie i można je skonfigurować w ustawieniach agenta:

DostawcaModel
ElevenLabsQwen3.6-35B-A3B
Qwen3.5-397B-A17B
GoogleGemini 3.7 Flash
Gemini 3.6 Flash
Gemini 3.5 Flash
Gemini 3.5 Flash-Lite
Gemini 3.1 Pro Preview
Gemini 3.1 Flash Lite
Gemini 3 Flash Preview
Gemini 2.5 Flash
Gemini 2.5 Flash Lite
OpenAIGPT-5.6 Sol
GPT-5.6 Terra
GPT-5.6 Luna
GPT-5.5
GPT-5.4
GPT-5.4 Mini
GPT-5.4 Nano
GPT-5.2
GPT-5.1
GPT-5
GPT-5 Mini
GPT-5 Nano
GPT-4.1
GPT-4.1 Mini
GPT-4.1 Nano
GPT-4o
GPT-4o Mini
AnthropicClaude Opus 4.8
Claude Opus 4.7
Claude Sonnet 5
Claude Sonnet 4.6
Claude Sonnet 4.5
Claude Haiku 4.5

Ceny są zwykle podawane w USD za 1 mln tokenów, chyba że zaznaczono inaczej. Token to podstawowa jednostka danych tekstowych dla LLM, odpowiadająca średnio około 4 znakom.

Własny LLM

Możesz użyć własnego LLM, wskazując endpoint, do którego mamy wysyłać żądania, i podając dane uwierzytelniające przez nasz bezpieczny magazyn sekretów. Dowiedz się więcej o integracji z własnym LLM.

Niektóre modele są niedostępne po włączeniu rezydencji danych w UE. Szczegóły dostępności znajdziesz w sekcji RODO i rezydencja danych.

Wybór modelu

Wybierając LLM najlepiej dopasowany do aplikacji, weź pod uwagę kilka czynników:

  • Złożoność zadania: Oceń modele na reprezentatywnych zadaniach z aplikacji
  • Wymagania dotyczące opóźnień: W przypadku rozmów głosowych na żywo wybierz model o niskich opóźnieniach i zmierz czas odpowiedzi z użyciem swoich promptów i narzędzi
  • Rozmiar okna kontekstowego: Jeśli aplikacja musi przetwarzać, rozumieć lub pamiętać informacje z długich rozmów albo obszernych dokumentów, wybierz modele z większymi oknami kontekstowymi
  • Opłacalność: Zestaw oczekiwaną wydajność i funkcje z budżetem. Ceny LLM mogą znacznie się różnić, więc przeanalizuj strukturę cenową (tokeny wejściowe, wyjściowe i cache) pod kątem przewidywanego użycia
  • Zgodność z HIPAA: Jeśli aplikacja przetwarza chronione informacje zdrowotne (PHI), użyj LLM oznaczonego jako zgodny z HIPAA i zadbaj o zgodność całego procesu obsługi danych z wymogami

Maksymalny rozmiar promptu systemowego to 2 MB. Obejmuje instrukcje agenta, zawartość bazy wiedzy i inny kontekst na poziomie systemu.

Konfiguracja modelu

Temperatura

Temperatura kontroluje losowość odpowiedzi modelu. Niższe wartości dają bardziej spójne, skupione wyniki, a wyższe zwiększają kreatywność i różnorodność.

  • Niska (0.0–0.3): Deterministyczne, spójne odpowiedzi do ustrukturyzowanych interakcji
  • Średnia (0.4–0.7): Równowaga między kreatywnością a spójnością
  • Wysoka (0.8–1.0): Kreatywne, zróżnicowane odpowiedzi do dynamicznych rozmów

Konfiguracja zapasowego LLM

Skonfiguruj zapasowe LLM, aby zapewnić ciągłość rozmowy, gdy główny LLM zawiedzie lub stanie się niedostępny.

Opcje konfiguracji:

  • Domyślna: Używa zalecanej przez ElevenLabs sekwencji awaryjnej
  • Własna: Zdefiniuj własną kaskadową sekwencję modeli zapasowych
  • Wyłączona: Bez rozwiązania awaryjnego (zdecydowanie odradzane w środowisku produkcyjnym)

Wyłączenie zapasowych LLM oznacza, że rozmowy zakończą się nagle, jeśli główny LLM zawiedzie lub stanie się niedostępny. Zdecydowanie odradzamy to w środowisku produkcyjnym.

Dowiedz się więcej o kaskadowaniu LLM.

Rozumowanie

Rozumowanie pomaga agentom podejmować złożone decyzje, na przykład wybierać narzędzia, stosować zasady czy realizować wieloetapowe workflow. W zależności od modelu kontrolujesz zakres rozumowania za pomocą budżetu myślenia lub poziomu wysiłku rozumowania.

Budżet myślenia

Ustaw maksymalną liczbę tokenów rozumowania za pomocą suwaka liczbowego. Większy budżet może wydłużyć czas odpowiedzi. Ustaw budżet na 0, aby wyłączyć myślenie, jeśli model na to pozwala.

Wysiłek rozumowania

Wysiłek rozumowania określa, ile rozumowania model wykonuje przed odpowiedzią. Dostępne poziomy zależą od wybranego modelu.

W przypadku agentów głosowych na żywo zacznij od niższego budżetu lub wysiłku, ponieważ dodatkowe myślenie może opóźnić zmianę tury. Zwiększ je dla kroków workflow wymagających bardziej złożonych decyzji.

Podsumowanie rozumowania

Włącz podsumowanie rozumowania, aby zapisywać zwrócone przez model rozumowanie podczas debugowania odpowiedzi, wywołań narzędzi lub ścieżek workflow. Włącz Podsumowanie rozumowania w ustawieniach LLM agenta albo ustaw enable_reasoning_summary przez API. To ustawienie jest domyślnie wyłączone.

W przypadku własnych endpointów zobacz jak ElevenLabs żąda i przechowuje rozumowanie.

Treść rozumowania podlega ustawieniom retencji i redakcji PII. Możesz uzyskać do niej dostęp przez następujące kanały:

Miejsce doceloweDostępność
Historia rozmowyDostępna pod oznaczeniem Rozumowanie
API pobierania rozmowyZwracana w polu reasoning elementu transkrypcji
OpenTelemetryUwzględniana w spanach odpowiedzi agenta po rozmowie jako elevenlabs.reasoning_content
Zdarzenia klientaDostępna jako agent_reasoning_response_part tylko w rozmowach tekstowych

W trybie Zero Retention Mode ElevenLabs **nie przechowuje treści rozumowania **. Jest ona dostarczana tylko klientom czatu i webhookom po rozmowie.

Ograniczenia

  • Żądanie podsumowania rozumowania może zwiększyć opóźnienie odpowiedzi. Przetestuj je, zanim włączysz je w agentach głosowych wrażliwych na opóźnienia.
  • Dostawcy mogą zwracać podsumowanie, tekst myśli, surowe delty rozumowania lub treść, której nie da się wyświetlić.

Jak rozumieć ceny

  • Tokeny: Korzystanie z LLM jest zwykle rozliczane na podstawie liczby przetworzonych tokenów. Dla tekstu angielskiego 100 tokenów to w przybliżeniu 75 słów
  • Ceny danych wejściowych i wyjściowych: Dostawcy często stosują inne ceny dla tokenów wejściowych (danych wysyłanych do modelu) i wyjściowych (danych generowanych przez model w odpowiedzi)
  • Ceny cache:
    • input_cache_read: Koszt pobrania z cache wcześniej przetworzonych danych wejściowych. Korzystanie z danych z cache może obniżyć koszty, jeśli identyczne dane wejściowe są przetwarzane wiele razy
    • input_cache_write: Koszt zapisania danych wejściowych w cache. Niektórzy dostawcy LLM mogą pobierać opłatę za tę operację
  • Ceny podane w tym dokumencie dotyczą 1 mln tokenów i bazują na informacjach dostępnych w chwili pisania. Dostawcy LLM mogą je zmienić

Aktualne możliwości modeli, ceny i warunki korzystania znajdziesz w dokumentacji dostawcy.

Zgodność z HIPAA

Niektóre LLM dostępne na naszej platformie mogą nadawać się do użycia w środowiskach wymagających zgodności z HIPAA. Więcej informacji znajdziesz w dokumentacji zgodności z HIPAA.

Powiązane materiały

Modele hostowane przez ElevenLabs

ElevenLabs oferuje dostęp do różnych modeli AI, w tym wybranych modeli innych firm hostowanych przez ElevenLabs.

Gdy model jest oznaczony jako „Hosted by ElevenLabs”, jest wdrażany i obsługiwany w infrastrukturze zarządzanej przez ElevenLabs. Modele te są obecnie hostowane w Stanach Zjednoczonych lub w regionie wdrożenia Enterprise.

Jak rozpoznać modele hostowane przez ElevenLabs

Modele hostowane przez ElevenLabs są wyraźnie oznaczone w interfejsie ElevenLabs. Podczas przeglądania lub wyboru modeli szukaj oznaczenia „Hosted by ElevenLabs”.

Jak obsługujemy twoje dane

W przypadku modeli hostowanych przez ElevenLabs żądania są przetwarzane w infrastrukturze zarządzanej przez ElevenLabs. Oznacza to, że oryginalny dostawca modelu nie otrzymuje, nie uzyskuje dostępu ani nie przetwarza danych wejściowych i wyjściowych przesłanych przez ElevenLabs.

Hostując te modele, ElevenLabs zapewnia spójne działanie i zachowuje kontrolę nad infrastrukturą obsługującą żądania do modeli.

Najczęstsze pytania

Gdzie hostowane są modele hostowane samodzielnie?

Modele hostowane przez ElevenLabs są obecnie hostowane w infrastrukturze zlokalizowanej w Stanach Zjednoczonych lub w regionie wdrożenia Enterprise.

Czy oryginalny dostawca modelu ma dostęp do moich danych lub metadanych użycia?

W przypadku modeli hostowanych przez ElevenLabs oryginalny deweloper modelu nigdy nie otrzymuje twoich danych wejściowych ani wyjściowych i nie ma dostępu do danych o wdrożeniu, które je przetwarza.

Skąd wiem, czy model jest hostowany przez ElevenLabs?

Modele hostowane przez ElevenLabs są wyraźnie oznaczone w interfejsie ElevenLabs jako „Hosted by ElevenLabs”.