3.5 Flash-Lite를 사용할 때는 다양한 사고 수준을 사용하여 품질, 속도, 토큰 출력을 최적화할 수 있습니다.
- 지연 시간에 민감하거나 더 간단한
분류 및 추출 작업에는
thinking_level.MINIMAL을 사용하세요. 3.5 Flash-Lite 는 기본적으로 최소 사고를 사용하며, 이는 속도와 비용 효율성을 최적화합니다. 이는 처리량이 많은 분류, 라우팅 또는 JSON 추출 작업에 적합합니다. - 하위 에이전트에는
thinking_level.MEDIUM또는thinking_level.HIGH를 사용하세요: 코드를 작성하거나 터미널 명령어를 실행하거나 외부 API를 호출하는 자율 하위 에이전트로 3.5 Flash-Lite를 사용하는 경우 사고 수준을 중간 또는 높음으로 설정하세요. 최소 사고 수준을 사용하면 다단계 작업에서 도구가 조기에 종료될 수 있습니다.
3.5 Flash-Lite에는 이전 Gemini 모델과 비교했을 때 다음과 같은 잠재적으로 호환성이 손상되는 변경사항이 포함되어 있습니다.
- 온도, Top-K, Top-P와 같은 매개변수의 맞춤 값은 지원되지 않습니다. 이러한 매개변수에 맞춤 값을 설정하면 해당 값은 무시됩니다.
- 빈도 및 상태 페널티 매개변수의 맞춤 값은 지원되지 않습니다. 이러한 매개변수에 맞춤 값을 설정하면 오류가 발생합니다.
- 마지막 입력 턴에
Model역할이 있는 API 요청은 지원되지 않습니다. 다음과 같은 종류의 요청은 오류를 반환합니다.- Interactions API를 사용하는 경우:
input배열의 마지막 객체에"type": "model_output"이 있는 요청 - GenerateContent API를 사용하는 경우:
contents배열의 마지막 객체에"role": "model"이 있는 요청
- Interactions API를 사용하는 경우:
Agent Studio에서 사용해 보기 예시 앱 배포 가격 책정
| 모델 ID | gemini-3.5-flash-lite |
|
|---|---|---|
| 형식 |
|
|
| 토큰 한도 | 컨텍스트 윈도우 | 1,048,576 |
| 최대 출력 토큰 | 65,536 | |
| 기능 |
|
|
| 도구 | ||
| 소비 옵션 |
|
|
| 기술 사양 | 이미지 |
|
| 텍스트 |
|
|
| 동영상 |
|
|
| 오디오 |
|
|
| 파라미터 기본값 |
|
|
| 지원되는 리전 |
|
|
|
||
|
||
|
||
| 버전 |
|
|
| 보안 제어 | 온라인 예측 |
|
| 일괄 추론 |
|
|
| 컨텍스트 캐싱 |
|
|
| 자세한 내용은 보안 제어를 참조하세요. | ||