
1. 先给结论:谁该用 GLM-5.3 中转
GLM-5.3 适合中文软件工程、Agent 工具循环,以及已经把客户端接到 OpenAI / Anthropic 兼容入口的团队。官方模型 ID 是 glm-5.3,文本模态,上下文 1M,最大输出 128K。思考功能始终开启,只支持 thinking.type: enabled,用 reasoning_effort 在 low / high / max 之间切换,默认 max。旧代码如果还在发 disabled,请求会失败。
中转解决的是入口和账单隔离,不是把官方 ¥8 / ¥28 自动变成页面上的 ¥0.392 / ¥1.232。需要看图、看视频、看文件时,应改走 glm-5.3-flash,不要逼文本旗舰吃多模态。
2. 模型 ID 与最小接入
公开详情页是智谱 GLM-5.3 API 中转,调用代号填 glm-5.3。点号 ID 和短横线 slug 不要混着抄进 URL。
curl https://www.codex789.com/v1/chat/completions \
-H "Authorization: Bearer sk-your-key" \
-H "Content-Type: application/json" \
-d '{"model":"glm-5.3","thinking":{"type":"enabled"},"reasoning_effort":"low","messages":[{"role":"user","content":"把这次发布回滚方案写成检查清单"}]}'从 5.2 迁到 5.3 前,先改思考参数,再改 model。官方迁移提示写得很直:继续发 thinking.type: disabled 会失败。流式时仍要同时处理推理增量和最终 content。
3. 价格为什么看起来便宜
2026-09-08 核对本站模型页 Offer:GLM-5.3 输入 ¥0.392、输出 ¥1.232 /百万 tokens,目录倍率 0.2x。同一天智谱定价页对 GLM-5.3 写的是输入 8 元、输出 28 元、缓存命中 2 元 /百万 tokens,缓存存储限时免费。0.2 × 8 / 28 并不等于 0.392 / 1.232,所以不能把“0.2x”说成官方价打二折后的保证结果。
| 口径 | 怎么读 | 不要当成 |
|---|---|---|
| 官方挂牌 | 输入 8 / 输出 28 元 | 本站实付 |
| 官方缓存命中 | 2 元 /百万 tokens | 每次请求都命中 |
| 本站可见参考价 | ¥0.392 / ¥1.232 | 合同单价 |
| 本站倍率 | 0.2x | 官方价 × 0.2 的保证结果 |
| 最终扣费 | 控制台流水 | 页面上的参考算术 |
Flash 官方表在同一天是另一套数字,而且带活动截止时间,下一节单独写。倍率公式见倍率指南。
4. 企业级怎么用才稳
稳定在这里等于可隔离、可核对、可回滚,不是未验证的 SLA:
- 密钥隔离:预发、生产和评测拆 Key。
- 额度上限:默认
reasoning_effort=max会拉长输出,生产 Key 必须有上限。 - 错误可观察:记录状态码、错误体、model 和 tokens;周对账用控制台 CSV。
- 模态边界:文本任务走 5.3,界面截图或视频理解走 Flash,避免同一把 Key 混打。
5. 和 GLM-5.3-Flash 怎么选
Flash 的公开详情页是GLM-5.3-Flash API。官方文档把它写成原生多模态:输入可以是图片、视频、文件和文本,上下文同样 1M,最大输出 128K。思考同样关不掉。本站 Flash 页没有可核对的固定输入/输出数字,价格以控制台为准,本文不把 Offer 里的 0 写成免费。
官方定价页 2026-09-08 对 Flash 的活动价是输入 0.4、输出 1.4 元 /百万 tokens(刊例价 0.8 / 2.8),活动截止 2026-09-09 24:00(北京时间)。过期后按刊例价,不把限时折扣写成长期承诺。
| 判断 | GLM-5.3 | GLM-5.3-Flash |
|---|---|---|
| 模型 ID | glm-5.3 | glm-5.3-flash |
| 模态 | 文本 | 图片、视频、文件、文本 |
| 官方窗口 / 最大输出 | 1M / 128K | 1M / 128K |
| 思考 | 始终开启 | 始终开启 |
| 官方输入 / 输出 | 8 / 28 元 | 活动 0.4 / 1.4,刊例 0.8 / 2.8 |
| 本站可见价 | ¥0.392 / ¥1.232 | 以控制台为准 |
Ox-Alpha 测试阶段的叙事见已有文章GLM-5.3-Flash 评测。本篇不重复那套实测故事,只回答现在该填哪个 ID、哪份价表。
6. 真实接入坑
- 从 5.2 改 ID 却不改思考参数,请求被拒绝。
- 把截图塞进
glm-5.3。官方写明 5.3 只处理文本。 - 把 Flash 活动价抄进内部报价单,又不写截止日期。
- HTTP 200 但界面空白:推理字段仍在
reasoning_content。见空回复排查。 - 默认
max思考打生产问答,输出又长又贵。低风险问答先用low。
家族层面怎么在 DeepSeek、GLM、Kimi 之间选,见国产模型 API 中转选型。
7. 一组可核对的费用例子
只演示算术。假设走本站可见参考价 ¥0.392 / ¥1.232,没有缓存、没有重试。
- 输入 20,000 tokens、输出 4,000 tokens:0.392×0.02 + 1.232×0.004 = 0.012768 元。
- 同一笔若按官方 8 / 28:8×0.02 + 28×0.004 = 0.272 元。目录价把这一笔缩小了一个数量级,前提是控制台按可见参考价结算。
- 若
reasoning_effort=max把输出从 4,000 拉到 20,000,输出项先变成 1.232×0.02 = 0.02464 元。企业要限思考档位,而不是只谈倍率。
8. Cursor / Codex / 自建服务怎么接
Base URL 指向 https://www.codex789.com/v1,模型填 glm-5.3 或 glm-5.3-flash。
- 自建后端超时覆盖完整工具循环。
- 文本生产线和多模态生产线拆 Key,账单才读得懂。
- 流式按 SSE 拼接;Flash 官方还建议同时开
stream与tool_stream,以控制台实际支持为准。
9. 稳定不等于不会 429
- 429 时读错误体,区分 RPM、TPM 和余额。
- 给思考档位和工具步数设上限。
- 评测脚本不要打生产 Key。
10. 常见问题
GLM-5.3 中转站是什么?
通过 OpenAI 兼容 Base URL 调用 glm-5.3 的渠道入口。权限、分组和账单以控制台为准。
0.2x 是不是官方 8 / 28 打二折?
不是保证算法。本站可见参考价是 ¥0.392 / ¥1.232,与官方挂牌分开记录。
GLM-5.3 能不能关掉思考?
官方当前文档写明不能关。需要更便宜的思考,把 reasoning_effort 设为 low。
Flash 活动价能写进合同吗?
不能当长期条款。核对日的活动截止时间是 2026-09-09 24:00 北京时间,之后按刊例价,且本站 Flash 仍以控制台为准。
规格来源:智谱《GLM-5.3》《GLM-5.3-Flash》与《API 定价》(5.3 为文本、1M 窗口、输入 8 / 输出 28 元;Flash 为多模态且思考不可关),核对日期 2026-09-08。本站可见价与倍率以控制台为准。