Vai alla navigazione

Modelli

Scopri come scegliere il modello giusto per il tuo caso d'uso

ElevenAgents offre un’interfaccia unificata per connettere il tuo agente a più modelli e provider, garantendo flessibilità, affidabilità e ottimizzazione dei costi.

Funzionalità principali

  • Accesso unificato: Passa da un provider o modello all’altro con modifiche minime al codice
  • Elevata affidabilità: Passa automaticamente da un provider a un altro in caso di errore
  • Monitoraggio della spesa: Monitora la spesa sui diversi modelli

Modelli supportati

Al momento, i seguenti modelli sono supportati nativamente e possono essere configurati dalle impostazioni dell’agente:

ProviderModello
ElevenLabsDeepSeek Flash 4.1
GLM 5.2
Qwen3.6-35B-A3B
Qwen3.5-397B-A17B
GoogleGemini 3.8 Flash
Gemini 3.7 Flash
Gemini 3.6 Flash
Gemini 3.5 Flash
Gemini 3.5 Flash-Lite
Gemini 3.1 Pro Preview
Gemini 3.1 Flash Lite
Gemini 3 Flash Preview
Gemini 2.5 Flash
Gemini 2.5 Flash Lite
OpenAIGPT-6.1 Sol
GPT-6 Astra
GPT-6 Sol
GPT-6 Luna
GPT-5.6 Sol
GPT-5.6 Terra
GPT-5.6 Luna
GPT-5.5
GPT-5.4
GPT-5.4 Mini
GPT-5.4 Nano
GPT-5.2
GPT-5.1
GPT-5
GPT-5 Mini
GPT-5 Nano
GPT-4.1
GPT-4.1 Mini
GPT-4.1 Nano
GPT-4o
GPT-4o Mini
AnthropicClaude Opus 5.5
Claude Opus 5
Claude Opus 4.8
Claude Opus 4.7
Claude Sonnet 5.5
Claude Sonnet 5
Claude Sonnet 4.6
Claude Sonnet 4.5
Claude Haiku 4.5

I prezzi sono generalmente indicati in USD per 1 milione di token, salvo diversa indicazione. Un token è un’ unità fondamentale di dati testuali per gli LLM, equivalente in media a circa 4 caratteri.

LLM personalizzato

Puoi utilizzare un LLM personalizzato specificando l’endpoint a cui inviare le richieste e fornendo le credenziali tramite il nostro archivio sicuro di segreti. Scopri di più sull’integrazione di LLM personalizzati.

Alcuni modelli non sono disponibili quando è attivata la residenza dei dati nell’UE. Consulta GDPR e residenza dei dati per i dettagli sulla disponibilità.

Scegliere un modello

Per selezionare l’LLM più adatto alla tua applicazione, considera diversi fattori:

  • Complessità dell’attività: Valuta i modelli rispetto ad attività rappresentative della tua applicazione
  • Requisiti di latenza: Per le conversazioni vocali in tempo reale, scegli un modello a bassa latenza e misura il tempo di risposta con i tuoi prompt e strumenti
  • Dimensione della finestra di contesto: Se la tua applicazione deve elaborare, comprendere o ricordare informazioni da lunghe conversazioni o documenti estesi, seleziona modelli con finestre di contesto più ampie
  • Rapporto costo-efficacia: Bilancia le prestazioni e le funzionalità desiderate con il tuo budget. I prezzi degli LLM possono variare notevolmente, quindi analizza la struttura dei prezzi (token di input, output e cache) in relazione ai modelli di utilizzo previsti
  • Conformità HIPAA: Se la tua applicazione coinvolge Informazioni Sanitarie Protette (PHI), è fondamentale usare un LLM designato come conforme a HIPAA e assicurarti che l’intero processo di gestione dei dati rispetti gli standard normativi

La dimensione massima del prompt di sistema è 2 MB e include le istruzioni dell’agente, i contenuti della knowledge base e altro contesto a livello di sistema.

Configurazione del modello

Temperatura

La temperatura controlla la casualità delle risposte del modello. Valori più bassi producono output più coerenti e mirati, mentre valori più alti aumentano creatività e varietà.

  • Bassa (0.0-0.3): Risposte deterministiche e coerenti per interazioni strutturate
  • Media (0.4-0.7): Creatività e coerenza bilanciate
  • Alta (0.8-1.0): Risposte creative e varie per conversazioni dinamiche

Configurazione dell’LLM di backup

Configura gli LLM di backup per garantire la continuità delle conversazioni quando l’LLM principale non funziona o non è disponibile.

Opzioni di configurazione:

  • Predefinita: Utilizza la sequenza di fallback consigliata da ElevenLabs
  • Personalizzata: Definisci la tua sequenza a cascata di modelli di backup
  • Disattivata: Nessun fallback (fortemente sconsigliato in produzione)

Disattivare gli LLM di backup significa che le conversazioni termineranno bruscamente se l’LLM principale non funziona o non è disponibile. Questa opzione è fortemente sconsigliata per l’uso in produzione.

Scopri di più sul cascading degli LLM.

Ragionamento

Il ragionamento aiuta gli agenti a gestire decisioni complesse, come scegliere tra gli strumenti, applicare policy o completare workflow in più passaggi. A seconda del modello, puoi controllare il livello di ragionamento tramite un budget di ragionamento o un livello di impegno nel ragionamento.

Budget di ragionamento

Imposta il numero massimo di token di ragionamento con il cursore numerico. Budget più elevati possono aumentare il tempo di risposta. Imposta il budget su 0 per disattivare il ragionamento, se il modello lo consente.

Impegno nel ragionamento

L’impegno nel ragionamento controlla quanto il modello ragiona prima di rispondere. I livelli disponibili dipendono dal modello selezionato.

Per gli agenti vocali in tempo reale, inizia con un budget o un livello di impegno più basso, perché un ragionamento aggiuntivo può ritardare l’alternanza dei turni. Aumentalo per i passaggi del workflow che richiedono decisioni più complesse.

Riepilogo del ragionamento

Attiva il riepilogo del ragionamento per acquisire il ragionamento restituito dal modello durante il debug di risposte, chiamate di strumenti o percorsi del workflow. Attiva Riepilogo del ragionamento nelle impostazioni LLM dell’agente oppure imposta enable_reasoning_summary tramite l’API. L’impostazione è disattivata per impostazione predefinita.

Per gli endpoint personalizzati, consulta come ElevenLabs richiede e archivia il ragionamento.

I contenuti del ragionamento sono soggetti alle impostazioni di conservazione e di rimozione dei PII. Puoi accedervi attraverso i seguenti canali:

DestinazioneDisponibilità
Cronologia conversazioniDisponibile con il badge Ragionamento
API per ottenere una conversazioneRestituito nel campo reasoning dell’elemento della trascrizione
OpenTelemetryIncluso negli span di risposta dell’agente post-chiamata come elevenlabs.reasoning_content
Eventi clientDisponibile come agent_reasoning_response_part solo nelle conversazioni testuali

Con la Modalità zero conservazione, ElevenLabs **non archivia i contenuti del ragionamento **. Vengono inviati solo ai client di chat e ai webhook post-chiamata.

Limitazioni

  • La richiesta di un riepilogo del ragionamento può aumentare la latenza della risposta. Testalo prima di attivarlo sugli agenti vocali sensibili alla latenza.
  • I provider possono restituire un riepilogo, testo del ragionamento, delta di ragionamento non elaborati oppure nessun contenuto visualizzabile.

Comprendere i prezzi

  • Token: L’utilizzo degli LLM viene generalmente fatturato in base al numero di token elaborati. Come riferimento generale per il testo in inglese, 100 token equivalgono approssimativamente a 75 parole
  • Prezzi di input e output: I provider spesso differenziano i prezzi per i token di input (i dati inviati al modello) e i token di output (i dati generati dal modello in risposta)
  • Prezzi della cache:
    • input_cache_read: Indica il costo associato al recupero dalla cache di dati di input elaborati in precedenza. L’utilizzo di dati memorizzati nella cache può ridurre i costi se input identici vengono elaborati più volte
    • input_cache_write: Indica il costo associato alla memorizzazione dei dati di input nella cache. Alcuni provider di LLM possono addebitare questo tipo di operazione
  • I prezzi indicati in questo documento sono per 1 milione di token e si basano sulle informazioni disponibili al momento della stesura. I provider di LLM possono modificare questi prezzi
  • Prezzi senza maggiorazione: ElevenLabs applica i costi degli LLM di terze parti alle tariffe pubblicate dai provider, senza maggiorazioni. Alcuni modelli Gemini e Claude sono allineati ai prezzi regionali (non globali) di Vertex AI, applicati al traffico negli Stati Uniti e nell’UE: un aumento del 10% sui token di input, output e cache, in linea con le tariffe regionali di Vertex

Per funzionalità, prezzi e termini di servizio aggiornati dei modelli, consulta la documentazione del provider.

Conformità HIPAA

Alcuni LLM disponibili sulla nostra piattaforma possono essere adatti all’uso in ambienti che richiedono la conformità HIPAA. Per maggiori dettagli, consulta la documentazione sulla conformità HIPAA.

Risorse correlate

Modelli forniti da ElevenLabs

ElevenLabs offre accesso a diversi modelli di IA, inclusi modelli selezionati di terze parti forniti da ElevenLabs.

Quando un modello è indicato come “Hosted by ElevenLabs”, viene distribuito e gestito su un’infrastruttura amministrata da ElevenLabs. Questi modelli sono attualmente forniti negli Stati Uniti o nella regione del tuo deployment enterprise.

Come identificare i modelli forniti da ElevenLabs

I modelli forniti da ElevenLabs sono chiaramente etichettati nell’interfaccia di ElevenLabs. Cerca la dicitura “Hosted by ElevenLabs” quando esplori o selezioni i modelli.

Come vengono gestiti i tuoi dati

Per i modelli forniti da ElevenLabs, le richieste vengono elaborate nell’infrastruttura gestita da ElevenLabs. Questo significa che il provider originale del modello non riceve, non accede e non elabora gli input e gli output inviati tramite ElevenLabs.

Fornendo questi modelli, ElevenLabs può offrire un’esperienza coerente mantenendo il controllo sull’infrastruttura utilizzata per gestire le richieste ai modelli.

Domande frequenti

Dove vengono forniti i modelli self-hosted?

I modelli forniti da ElevenLabs sono attualmente forniti su infrastrutture situate negli Stati Uniti o nella regione del tuo deployment enterprise.

Il provider originale del modello accede ai miei dati o ai metadati del mio utilizzo?

Per i modelli forniti da ElevenLabs, lo sviluppatore originale del modello non riceve mai i tuoi input o output e non ha accesso ai dati relativi al deployment che li elabora.

Come faccio a sapere se un modello è fornito da ElevenLabs?

I modelli forniti da ElevenLabs sono chiaramente identificati nell’interfaccia di ElevenLabs con la dicitura “Hosted by ElevenLabs”.