1. Gemini 2.5 Flash-Lite 是什么
Gemini 2.5 Flash-Lite(gemini-2-5-flash-lite)是 2.5 代际的极致轻量型号:以最小的规格与全站最低的文本单价,承接那些「量大、任务简单、对单价零容忍」的调用。
它的目录画像:
- 256K tokens 上下文:同代 Lite 档的标准规格。
- 能力标签:轻量级、快速响应——不含视觉理解等扩展模态。
- $0.7/$3.5 每百万 tokens:站内文本档的最低渠道目录参考价。
2. 地板价的适用边界
最便宜的型号不是万能型号,边界清单比价格本身更有价值:
| 判断 | 任务特征 |
|---|---|
| ✅ 放心交给它 | 短文本分类、关键词抽取、格式转换、模板化回复、简单校验 |
| ⚠️ 先测试再决定 | 中等长度摘要、多约束改写、轻度推理问答 |
| ❌ 不要交给它 | 图像相关任务(无视觉标签)、复杂推导、长链路 Agent 规划 |
一个实用的验收方法:从真实流量里抽 100 条样本跑一遍,人工核对错误率——若错误率可接受,就把这批流量永久下沉到地板价,省下的部分再反哺给高难度任务的旗舰档。
地板价能省出什么量级?算一笔账:某分类管道每月消耗 3,000 万 input tokens 与 500 万 output tokens——跑在本页的目录成本约 $38.5($21 + $17.5),若改用标准 Flash 档则约 $82.5,省下过半。规模越大,这道算术题的答案越清晰。
3. 适用场景
超大批量的规则化处理
日处理数万条的消息清洗、去重与打标,单条成本趋近于零后,数据管道的经济学才真正成立。
对话系统的前置分流
先用地板价判断用户意图属于闲聊、查询还是业务操作,再把后者路由给更强的型号处理。
教学与原型验证
学习提示词工程、验证产品构想的阶段,用最低成本把想法跑起来,成功后再评估升级路径。
4. API 最小示例
curl https://www.codex789.com/v1/chat/completions \
-H "Authorization: Bearer sk-codex789-your-api-key" \
-H "Content-Type: application/json" \
-d '{
"model": "gemini-2-5-flash-lite",
"messages": [
{"role": "user", "content": "把这句话改写得更正式一些"}
]
}'
Python SDK
from openai import OpenAI
client = OpenAI(
base_url="https://www.codex789.com/v1",
api_key="sk-codex789-your-api-key",
)
resp = client.chat.completions.create(
model="gemini-2-5-flash-lite",
messages=[{"role": "user", "content": "判断这条工单应该派给哪个部门"}],
)
print(resp.choices[0].message.content)
5. 价格与倍率说明
| 计费项 | 说明 |
|---|---|
| 站内倍率 | 0.2x,Gemini 系列统一,以控制台实时展示为准 |
| 渠道目录参考价 | $0.7 / $3.5 每百万 tokens(input/output),站内文本档最低 |
| 结算方式 | 按 Token 用量 × 倍率结算,明细以控制台账单为准 |
| 成本定位 | 全站价格地板——高频海量任务的成本终点站 |
6. 常见问题
Gemini 2.5 Flash-Lite 的调用代号是什么?
调用代号为 gemini-2-5-flash-lite,具体可用状态以控制台模型列表为准。
它真的是站内最便宜的文本模型吗?
按目录基准价衡量是的:$0.7/$3.5 每百万 tokens(input/output)为站内文本档的最低价位,站内倍率与其他 Gemini 型号一致为 0.2x。
256K tokens 的窗口够用吗?
对分类、抽取、短摘要这类典型低价场景绰绰有余;整库代码或数百页文档的超长输入应转向 512K 及以上的型号。
目录里没有视觉理解标签意味着什么?
表示图像输入不在其标注的能力范围内,涉及看图的任务请改用带视觉理解标签的型号;纯文本链路则完全不受影响。
它和 3.1 Flash-Lite 是什么关系?
两者是相邻两代的 Lite 档:本页更便宜但窗口减半且代际较旧;3.1 Flash-Lite 以小幅差价提供 512K 窗口,是多数新负载的优先选项。