
1. 先给结论:谁该用
如果你已经把 Cursor、Codex 或自建后端接到 https://www.codex789.com/v1,现在要加一个 1M 上下文、能看图、能开思考、还能走工具调用的国产模型,应优先核对 deepseek-flash。公开型号页是DeepSeek V4.1 Flash,不要把新闻标题里的 V4.1 Flash 直接填进 model。
中转的价值不在口号,而在账本和隔离:同一条 Base URL、可见目录价、按环境拆 Key。它不是免费号池,也不是把官方闲时价自动写成控制台流水。
2. 模型 ID 与版本迁移
新项目使用 deepseek-flash。旧文档中的 deepseek-v4-flash 与 deepseek-v4-flash-vision-exp 是兼容路由,不应继续写入新配置。迁移时同时更新环境变量、缓存键、监控标签和费用报表,避免同一模型被拆成多个名字。
建议先灰度:保留旧路由只用于回滚,新增请求固定写新 ID;记录请求 ID、HTTP 状态、错误码和 usage。只有在短请求、长上下文和视觉请求分别通过后,才扩大流量。
3. 价格为什么看起来便宜
官方挂牌和本站可见价是两套数字。本站国产模型渠道按 0.2x 展示目录参考价:输入 ¥0.20 / MT、输出 ¥0.80 / MT。官方定价页把缓存命中、未命中和输出按闲时/高峰分列。不能用一句“0.2x”直接换算所有账单,尤其不能把官方缓存命中价写成控制台实付。
| 项目 | 官方闲时 | 官方高峰 | 本站目录参考 |
|---|---|---|---|
| 缓存命中 | ¥0.02/MT | ¥0.04/MT | 以控制台为准 |
| 缓存未命中输入 | ¥1/MT | ¥2/MT | ¥0.20 / ¥0.40 |
| 输出 | ¥4/MT | ¥8/MT | ¥0.80 / ¥1.60 |
4. 企业级怎么用才稳
稳定首先来自分账,而不是把所有人塞进一把 Key。按项目或环境拆 Key,生产 Key 放服务端环境变量,不要写进前端、日志或截图。给思考模式单独设超时和最大输出,避免把 reasoning 当作失败重试信号。
客户端应记录请求 ID、模型 ID、usage 和错误码,失败后按幂等键重试查询或短请求,而不是无限制重复提交长上下文。429 需要队列和指数退避;一次 401 只说明认证失败,不能据此改模型或改价。
更完整的倍率与账单口径见中转站价格怎么算。
5. 和 Kimi / GLM / 旧 DeepSeek 怎么选
| 候选 | 何时优先 | 不要这样选 |
|---|---|---|
| deepseek-flash | 新项目要 1M、视觉和工具调用 | 用旧别名冒充新 ID |
| Kimi K3 | 已按 Kimi 协议接好长循环 | 把 K2.7 Code 当成 K3 |
| GLM-5.3 | 需要思考模式和该系列价格对照 | 未核验就宣称更快更强 |
| DeepSeek V4 Pro 0813 | 必须锁定日期版本 | 用 Pro 页价格推断 Flash |
总入口也可以从国产大模型 API 中转站怎么选进入,再落到具体型号页。
6. 真实接入坑
- 把新闻名
deepseek-v4.1-flash填进请求,控制台实际认的是deepseek-flash。 - 开启 Thinking 后只读
content,把还在输出 reasoning 的响应当成空回复。 - 视觉请求把图片放在错误字段,网关返回 400 后反复换模型,而不是先固定请求结构。
- 1M 窗口被当成“可以每次都塞满”,输入 tokens 把目录参考价放大到无法对账。
- 用未携带 Key 的 401 探针去宣传可用、更快或更稳。
7. 可核对费用例子
按闲时、缓存未命中、本站 0.2x 目录参考估算:
| 场景 | 输入 / 输出 | 本站参考 | 说明 |
|---|---|---|---|
| 配置检查 | 2K / 0.5K | 约 ¥0.0008 | 只验证 ID 和鉴权 |
| 中文工单归纳 | 30K / 2K | 约 ¥0.0076 | 适合日常知识工作 |
| 带图文档问答 | 120K / 6K | 约 ¥0.0288 | 图片协议必须先打通 |
| 长仓库审查 | 600K / 12K | 约 ¥0.1296 | 应拆仓库,避免整库重试 |
高峰时段官方未命中输入和输出都会翻倍,本站目录参考也会按 0.2x 同步放大。任何“固定最低价”都缺少账单样本,不能写进生产预算。
8. Cursor / Codex 怎么接
客户端只改三处:Base URL、model=deepseek-flash、服务端 Key。不要把 Key 写进仓库。先发一条短请求,确认返回里有模型 ID 和 usage,再打开长上下文或工具调用。
curl https://www.codex789.com/v1/chat/completions \
-H "Authorization: Bearer sk-codex789-your-api-key" \
-H "Content-Type: application/json" \
-d '{"model":"deepseek-flash","messages":[{"role":"user","content":"列出迁移检查项"}],"max_tokens":256}'Python 和 Node 只改 base_url 与 model。流式响应可能同时给出思考内容和最终内容,客户端应分别落盘。工具接入总览见使用指南。
9. 401 探针边界
2026-09-11 对 POST /v1/chat/completions 未携带 Key 的请求返回 HTTP 401 和 API_KEY_REQUIRED。该证据用于说明网关有鉴权,不说明 deepseek-flash 对当前账户一定可用,也不说明官方 1M 窗口已经在本站账户生效。
11. 思考模式、视觉和 usage 怎么记
Thinking 打开后,响应里可能先出现推理内容。只读最终 content 会把正常思考过程看成空回复,进而错误重试。正确做法是同时落盘 reasoning 字段、content、usage 和结束原因。超时后不要用同一幂等键再提交一份完整长上下文,先查原请求是否已经产生 usage。
视觉请求把文本和图片放进 content 数组。图片 URL 失效、MIME 不对或客户端只支持纯文本时,常见结果是 400。先保存脱敏请求结构,再判断是协议问题还是权限问题。不要在 400 上连续更换模型 ID。
usage 是对账依据。输入 tokens 包含历史消息、系统提示和图片折算,输出 tokens 包含可见回答;是否计入思考 tokens 以实际返回字段为准。没有 usage 的截图不能当账单证据。
12. 灰度清单
上线顺序建议固定为:鉴权短请求、普通中文问答、长文档、视觉、工具调用。每一步都要留下请求 ID 和 usage。某一步失败时停在该步,不把错误归因到“中转不稳定”或“模型不够强”。
灰度样本应覆盖闲时和你实际工作时段,因为官方高峰价会改变目录参考。不要只用一条成功请求就宣布全量切换。回滚准备的是旧模型 ID 和旧环境变量,而不是另一家未核验的供应商口号。
禁止写入页面或工单的内容包括:真实 API Key、用户邮箱、原始 Prompt、模型完整响应、支付流水号。脱敏探针只保留状态码、错误码和日期。
13. 哪些句子不要写进对外说明
不要写“官方 1M 已经保证每个 Key 都能用满”。不要写“0.2x 等于全天最低价”。不要写“401 探针证明模型已对所有用户开放”。不要写“比 Kimi 或 GLM 更快更强”。这些句子都缺少对应证据。
可以写的是:官方 ID、官方分时价、本站目录参考价、统一 Base URL、Key 隔离方法和本次 401 状态码。对外说明应指向型号页和控制台,而不是把估算表说成合同价。
14. 下一步
先打开型号页核对 ID 和目录价,再在控制台创建专用 Key,最后用短请求拿到 usage。需要比较国产长上下文时,再读 Kimi K3 与 GLM-5.3 的型号页。不要并行新建同义关键词页面;等这些 URL 产生抓取和展示数据后再决定是否扩展。注册和创建 Key 仍走站内控制台,不把密钥写进文章。
10. 常见问题
deepseek-flash 和 deepseek-v4.1-flash 一样吗?
页面版本名是 DeepSeek V4.1 Flash,官方推荐 API ID 是 deepseek-flash。请求字段按控制台可见 ID 填写。
0.2x 是否代表固定最终价格?
不是。0.2x 是本站国产模型渠道倍率,目录价用于估算;账户余额、时段和缓存等规则以控制台为准。
支持哪些协议?
官方资料列出 Responses API、Anthropic API 和工具调用能力;本站页面示例使用 OpenAI 兼容 Chat Completions,其他协议需按控制台权限验证。
本文不对速度、成功率、质量排名或 SLA 作未经实测的承诺。规格和价格复核日期:2026-09-11。