1. Gemini 3.1 Flash-Lite 是什么
Gemini 3.1 Flash-Lite(gemini-3-1-flash-lite)是 Google 3.x 代面向极限成本控制的轻量型号:在保留大窗口的前提下把价格压到低位,让高频小任务不再有账单压力。
它的目录画像:
- 512K tokens 上下文:低价档中少见的大窗口,长于同价位竞品。
- 能力标签:轻量级、高性价比——定位就是规模化跑量。
- $0.8/$4 每百万 tokens:约为标准 Flash 档的一半。
2. 成本定位与低价档分工
| 维度 | 3.1 Lite(本页) | 2.5 Lite |
|---|---|---|
| 渠道目录参考价* | $0.8 / $4 | $0.7 / $3.5 |
| 上下文 | 512K tokens | 256K tokens |
| 代际 | 较新 | 上一代 |
| 推荐角色 | 新项目低价默认档 | 短文本存量延续 |
* 公开目录信息。算一笔账:每月 2,000 万 output tokens 的分类任务,3.1 Lite 目录成本 $80,比标准 Flash 档($150)节省近一半;与 2.5 Lite 相比虽贵 $10,却换来翻倍的窗口与新代际质量——除非预算卡到极致且材料确定很短,否则优先本页型号,省下的差价远不够覆盖重模型返工的成本。
3. 适用场景
海量文本分类打标
评论倾向、工单路由、内容审核初筛等毫秒级决策链路,单价最低化是第一目标。
结构化信息抽取
从固定模板文本中提取字段并输出 JSON,任务简单到不需要重模型介入。
对话系统的兜底层
意图识别与闲聊应答走 Lite 档,识别到复杂诉求再升级上层模型,形成漏斗式成本结构。
4. API 最小示例
curl https://www.codex789.com/v1/chat/completions \
-H "Authorization: Bearer sk-codex789-your-api-key" \
-H "Content-Type: application/json" \
-d '{
"model": "gemini-3-1-flash-lite",
"messages": [
{"role": "user", "content": "判断这条评论的情感倾向并输出 JSON"}
]
}'
Python SDK
from openai import OpenAI
client = OpenAI(
base_url="https://www.codex789.com/v1",
api_key="sk-codex789-your-api-key",
)
resp = client.chat.completions.create(
model="gemini-3-1-flash-lite",
messages=[{"role": "user", "content": "从这句话里抽取人名、地点和时间"}],
)
print(resp.choices[0].message.content)
5. 价格与倍率说明
| 计费项 | 说明 |
|---|---|
| 站内倍率 | 0.2x,Gemini 系列统一,以控制台实时展示为准 |
| 渠道目录参考价 | $0.8 / $4 每百万 tokens(input/output),为公开目录信息 |
| 结算方式 | 按 Token 用量 × 倍率结算,明细以控制台账单为准 |
| 成本定位 | Gemini 系现役最低价档之一——「每个 Token 都要抠」场景的默认落点 |
6. 常见问题
Gemini 3.1 Flash-Lite 的调用代号是什么?
调用代号为 gemini-3.1-flash-lite,URL 路径中的连字符写法为 gemini-3-1-flash-lite,具体可用状态以控制台模型列表为准。
它和更便宜的 2.5 Flash-Lite 怎么选?
2.5 Lite 基准价略低($0.7/$3.5)但只有 256K 上下文;本页 3.1 Lite 以 $0.8/$4 提供 512K 窗口与更新的代际能力。长材料或新项目建议选 3.1 Lite,极致压价且材料短才考虑 2.5 Lite。
高并发场景使用时要注意什么?
建议客户端做并发上限与退避重试控制,避免瞬时峰值触发限流;配合队列消费模式可以把大批量任务跑得又稳又省。
哪些任务不该用 Lite 档?
复杂推理、长链路 Agent 规划、需要音频输入的任务不在其标签覆盖内,应交给 Pro 档或带相应标签的型号处理。
这一档的费用水平如何?
渠道目录参考价 $0.8/$4 每百万 tokens(input/output),站内倍率 0.2x,是 Gemini 系现役低价档之一,明细见控制台账单。