使用 3.5 Flash-Lite 时,您可以使用不同的思考级别来优化质量、速度和 token 输出:
- 对于延迟时间敏感或更简单的
分类和提取任务,请使用
thinking_level.MINIMAL:3.5 Flash-Lite 默认采用最低思考级别,可优化速度和成本效益。 这非常适合高吞吐量分类、路由或 JSON 提取任务。 - 对于子代理,请使用
thinking_level.MEDIUM或thinking_level.HIGH:如果您 将 3.5 Flash-Lite 用作编写代码、运行终端命令或调用外部 API 的自主子代理,请将 思考级别设置为中或高。在多步任务中使用最低思考级别可能会导致工具过早终止。
与之前的 Gemini 模型相比,3.5 Flash-Lite 包含以下可能会导致重大变更的内容:
- 不支持温度、Top-K 和 Top-P 等参数的自定义值。如果您为这些参数设置了自定义值,系统会忽略该值。
- 不支持频次和存在性惩罚参数的自定义值。为这些参数设置自定义值会抛出错误。
- 不支持最后一个输入轮次的角色为
Model的 API 请求。以下类型的请求会返回错误:- 使用 Interactions API 时:
input数组中最后一个对象的"type": "model_output"请求。 - 使用 GenerateContent API 时:
数组中最后一个对象的
contents请求具有"role": "model"。
- 使用 Interactions API 时:
| 模型 ID | gemini-3.5-flash-lite |
|
|---|---|---|
| 模态 |
|
|
| token 数量上限 | 上下文窗口 | 1,048,576 |
| 输出词元数上限 | 65536 | |
| 功能 |
| |