您的位置:首页 > 手游攻略 > Gemini 3.5 Flash-Lite - 谷歌推出轻量版 AI 模型
Gemini 3.5 Flash-Lite - 谷歌推出轻量版 AI 模型
作者:互联网 时间: 2026-07-22 17:58:03
Gemini 3.5 Flash-Lite是什么
Gemini 3.5 Flash-Lite 是 Google 推出的最快、最便宜的 Gemini 3.5 系列模型,专为高吞吐、低延迟的生产级 Agent 工作流设计。模型支持可调推理档位,输出速度达 350 token/s,定价仅 $0.30/$2.50 每百万 token,在多项 Agent 与代码基准上反超前代 3 Flash,适合批量文档处理、子 Agent 协作与实时交互场景。

Gemini 3.5 Flash-Lite的主要功能
- 极速输出:3.5 系列中最快,Artificial Analysis 实测达 350 输出 token/秒。
- 可调推理档位:支持低/中/高多档思考模式,简单任务开最低档保速度,复杂子任务调高档保质量。
- 内置计算机操作:Computer Use 成为内置工具,开箱即用支持 Agent 任务。
- 质量越级提升:相比 3.1 Flash-Lite,代码、长上下文与真实任务执行能力大幅跃升。
Gemini 3.5 Flash-Lite的技术原理
- 架构基础:基于 Gemini 3.5 Flash 架构精简优化,保留核心能力同时极致压缩推理开销。
- 动态思考模式:通过可配置的思考深度(thinking levels),在延迟与质量间按需切换。
- 高吞吐优化:针对批量文档处理、Agent 搜索等场景优化并行生成效率,实现 350 token/s 的峰值输出。
如何使用Gemini 3.5 Flash-Lite
- 开发者:通过 Google AI Studio、Gemini API 调用,支持灵活配置思考档位。
- 企业用户:集成于 Gemini Enterprise Agent Platform,适合高并发生产流量。
- 普通用户:已逐步 rollout 至 Google Search 等消费端场景。
Gemini 3.5 Flash-Lite的核心优势
- 速度成本双极致:350 token/s 的生成速度配合 $0.3/$2.5 的定价,大规模任务成本极低。
- 以小博大:在 SWE-Bench Pro和 OSWorld-Verified(74.0% vs 65.1%)上反超辈分更高的 3 Flash。
- 弹性思考档位:开发者可按任务复杂度自由切换推理深度,无需为简单任务支付不必要的计算开销。
- Agent 原生:内置 Computer Use 与多档思考模式,专为子 Agent 协作、批量数据处理等场景设计。
Gemini 3.5 Flash-Lite的同类竞品对比
对比维度 | Gemini 3.5 Flash-Lite | Gemini 3.1 Flash-Lite | Terminal-Bench 2.154.0%31.0%
GDPval-AA v21140642
GDM-MRCR v272.2%60.1%
输出速度350 token/s未公开
输入价格$0.30/百万 token更高
输出价格$2.50/百万 token更高
Gemini 3.5 Flash-Lite的应用场景
- 高吞吐 Agent 搜索:大规模网页检索、信息聚合与摘要生成,低延迟响应用户查询。
- 批量文档处理: Receipt 翻译、电商产品特征提取、合同批量解析等海量数据流水线。
- 子 Agent 协作:作为主 Agent(如 3.6 Flash)的副手,快速生成多版本方案(如 25 个网页设计概念)供筛选。
- 实时交互应用:客服机器人、实时推荐系统、低延迟对话接口等需要快速响应的场景。
- 轻量级游戏/创意生成:快速迭代生成小游戏原型、视觉素材,配合人类反馈即时调优。