模型定位:快速反馈优先
GLM-5.3-Flash 可以理解为 GLM-5.3 系列中的效率型号:重点是缩短首 token 等待、维持连续对话吞吐,并把文本、截图和工具结果放在同一条工作流中。它更适合“观察—修改—测试—复核”的短循环,而不是把未经整理的整库内容一次性塞入上下文。
- 前端与 UI 调试:结合截图、DOM 信息和回归截图定位布局问题。
- Coding Agent:配合搜索、编辑、测试工具执行多轮任务。
- 长文档问答:对需求、规范和代码索引做分区检索与归纳。
Ox-Alpha:正式名称之前的测试代号
Ox-Alpha 是 GLM-5.3-Flash 在正式命名之前使用的测试代号。匿名测试阶段的讨论重点并不在代号本身,而在模型能否稳定完成连续任务:长上下文是否能召回关键片段、工具参数是否保持一致、截图理解能否转化为可执行修改,以及高并发时响应是否仍然可用。
复盘测试时应保留模型列表快照、请求时间、输入类型、上下文长度、首 token 延迟、总耗时、错误码和最终代码差异。这样才能把测试代号阶段的体验与正式 glm-5.3-flash 做同题比较。
规格与能力
| 维度 | 当前公开口径 | 落地时如何核验 |
|---|---|---|
| 架构 | 约 320B 总参数、约 18B 激活的 MoE 路线 | 以实际吞吐和延迟为准,不从总参数推断速度 |
| 上下文 | 约 1M 级,具体上限随接口目录变化 | 用首段、中段、末段问题测试有效召回 |
| 输入能力 | 原生多模态方向,支持视觉任务 | 确认渠道允许的图片、文件格式和大小 |
| 协议 | OpenAI 兼容 Chat Completions | 从 /v1/models 复制精确模型 id |
多模态能力由模型和渠道共同决定。遇到输入校验错误时,先缩小文件、确认 MIME 类型,再检查 content 数组格式。
价格与倍率:以实时目录为准
本站已上线 glm-5.3-flash,当前站内倍率为 0.2x。倍率是结算系数,不等同于固定人民币单价;输入、输出、缓存读写和上下文分档价格可能随渠道调整,生产预算应以控制台实时目录为准。
任务适配矩阵
| 任务 | 推荐度 | 建议工作流 | 需要人工复核的点 |
|---|---|---|---|
| UI 截图与前端修复 | 高 | 截图 + 问题清单 + 修改 + 回归截图 | 像素、颜色和断点尺寸 |
| 工具型 Coding Agent | 高 | 固定 schema,逐轮保存工具结果 | 参数类型、权限和副作用 |
| 长文档问答 | 中高 | 章节分块、索引摘要、首中尾召回测试 | 引用位置和遗漏率 |
| 高风险自动发布 | 中 | 生成变更、运行检查、人工审批、可回滚 | 生产配置和数据写入 |
从 Ox-Alpha 迁移到正式模型
- 将客户端模型字段从
ox-alpha改为glm-5.3-flash。 - 使用同一批文本、截图和工具任务记录延迟、成功率、输出差异和费用。
- 重新检查上下文上限、图片大小、工具参数和错误码。
- 确认账单中的输入、输出和缓存计费后,再扩大并发。
OpenAI 兼容 API 接入
curl https://www.codex789.com/v1/chat/completions \
-H "Authorization: Bearer sk-codex789-your-api-key" \
-H "Content-Type: application/json" \
-d '{"model":"glm-5.3-flash","messages":[{"role":"user","content":"把这份需求拆成可执行的开发任务"}]}'切换模型时只修改 model 字段。上线前固定一组文本、截图和长上下文样本,记录成功率、延迟、输出质量与费用。
来源与口径
模型规格和协议说明以本站模型目录、接口返回和OpenAI 兼容接口说明为准;站内倍率和最终人民币单价以本站控制台模型目录为准。Ox-Alpha 部分是正式发布前测试阶段的经验归纳,适合用于历史复盘,不替代正式版本的同题实测。
页面最后更新:2026-08-29。规格、价格或模型 id 发生变化时,应同步更新本页、模型目录和机器可读清单。
常见问题
GLM-5.3-Flash 的正式调用代号是什么?
正式调用代号是 glm-5.3-flash。从模型广场或 /v1/models 复制当前可用 id。
Ox-Alpha 还需要写进生产配置吗?
Ox-Alpha 仅用于测试阶段复盘;生产配置使用正式代号 glm-5.3-flash。
站内倍率和实际价格有什么区别?
当前站内倍率为 0.2x,倍率是结算系数,输入、输出和缓存的实际单价以控制台实时目录为准。