탐색으로 건너뛰기

LLM 캐스케이딩

Agents Platform이 캐스케이드 폴백 메커니즘을 사용해 안정적인 LLM 응답을 보장하는 방법을 알아보세요.

개요

Agents Platform은 텍스트 생성 기능의 신뢰성과 복원력을 높이기 위해 LLM 캐스케이딩 메커니즘을 사용합니다. 기본으로 구성된 LLM에 실패가 발생하면 이 시스템은 자동으로 백업 대규모 언어 모델(LLM)을 사용하여 더 원활하고 일관된 사용자 경험을 보장합니다.

실패에는 API 오류, 시간 초과 또는 LLM 제공업체의 빈 응답 등이 포함될 수 있습니다. 캐스케이드 로직은 이러한 상황을 원활하게 처리합니다.

작동 방식

캐스케이딩 프로세스는 정의된 순서를 따릅니다:

  1. 선호 LLM 시도: 시스템은 먼저 에이전트 구성에서 선택한 LLM을 사용하여 응답을 생성하려고 시도합니다.

  2. 백업 LLM 순서: 선호 LLM이 실패하면 시스템은 미리 정의된 백업 LLM 순서로 자동 폴백합니다. 이 순서는 모델 성능, 속도 및 신뢰성을 기준으로 선정됩니다. 현재 기본 순서(변경될 수 있음)는 다음과 같습니다:

    1. Gemini 2.5 Flash
    2. GPT-4o
    3. Gemini 2.5 Flash Lite
    4. Claude Sonnet 4.5
  3. HIPAA 규정 준수: 에이전트가 엄격한 데이터 개인정보 보호가 필요한 모드(HIPAA 규정 준수/데이터 보존 없음)에서 작동하는 경우, 백업 목록은 위 순서 중 규정을 준수하는 모델만 포함하도록 필터링됩니다.

  4. 재시도: 시스템은 사용 가능한 LLM 순서(선호 모델 + 백업 모델)에서 생성 프로세스를 여러 번(최소 3회) 재시도합니다. 백업 LLM도 실패하면 순서상 다음 모델로 진행합니다. 재시도 한도 내에서 고유한 백업 LLM을 모두 사용하면 이전에 실패한 백업 모델을 다시 시도할 수 있습니다.

  5. 지연 초기화: 백업 LLM 연결은 필요할 때만 초기화되어 리소스 사용을 최적화합니다.

백업 LLM의 구체적인 목록과 순서는 ElevenLabs가 내부적으로 관리하며 성능과 가용성에 맞게 최적화됩니다. 위 목록은 현재 기본값이지만 별도 공지 없이 업데이트될 수 있습니다.

사용자 지정 LLM

사용자 지정 LLM을 구성하면 다른 모델로의 표준 캐스케이딩 로직은 우회됩니다. 시스템은 지정한 사용자 지정 LLM을 사용하려고 시도합니다.

사용자 지정 LLM이 실패하면 시스템은 요청 실패로 처리하기 전에 동일한 사용자 지정 LLM으로 여러 번(표준 최소 재시도 횟수와 동일) 요청을 재시도합니다. ElevenLabs 호스팅 모델로 폴백하지 않으므로 지정한 구성이 유지됩니다.

장점

  • 신뢰성 향상: 특정 LLM 제공업체에서 발생하는 일시적 문제의 영향을 줄입니다.
  • 가용성 향상: 부분적인 LLM 장애 중에도 응답을 성공적으로 생성할 가능성을 높입니다.
  • 원활한 운영: 폴백 메커니즘은 자동으로 작동하며 최종 사용자에게 투명하게 처리됩니다.

구성

LLM 캐스케이딩은 자동 백그라운드 프로세스입니다. 필요한 구성은 에이전트 설정에서 선호 LLM을 선택하는 것뿐입니다. 강력한 성능을 보장하기 위한 나머지 작업은 시스템이 처리합니다.