1. 先按任务,再看模型家族
| 任务 | 优先比较 | 验证重点 |
|---|---|---|
| 复杂推理、代码审查 | DeepSeek V4 Pro 与同系 Flash | 长上下文、输出长度、TPM 窗口 |
| 中文办公、知识库 | GLM-5.2、GLM-5.3 | 中文格式、结构化输出和成本 |
| 通用内容与长文 | Qwen3.7 Max、Qwen3.7 Plus | 提示词长度、输出稳定性 |
| 批量内容、产品集成 | MiniMax M3、M2.7 | 并发、批量吞吐和费用 |
| 中文对话与代码辅助 | Kimi K3、Kimi K2.7 Code | 上下文、工具调用和模型权限 |
表格是测试起点,不是永久排名。模型代号、倍率和可见权限以模型广场与 API 密钥分组为准。
2. 用一个 OpenAI 兼容入口验证
本站的 AI API 中转站把多家模型放进统一的密钥和用量管理。先用短提示验证认证与模型权限,再逐步加入业务上下文:
curl https://www.codex789.com/v1/chat/completions \
-H "Authorization: Bearer YOUR_API_KEY" \
-H "Content-Type: application/json" \
-d '{"model":"MODEL_ID","messages":[{"role":"user","content":"只返回 OK"}],"stream":false}'不要把官网展示名、本站展示名和调用代号混为一谈。若出现模型不存在,第一步是重新从密钥页面复制代号,而不是继续改请求体。
完成最小请求后,再参考OpenAI 兼容 API 教程接入 Python、Node.js 或现有 SDK。
3. 429、TPM 与“Server Busy”要分开看
公开 GitHub issue 中可以看到两类典型线索:TPM rate limit说明 Token 窗口可能先于余额耗尽;Server Busy则可能是上游暂时容量不足。它们都不适合用无限重试解决。
- 把并发降到 1,固定一个短请求。
- 记录状态码、请求 ID、模型代号和时间窗。
- 只对 408、429、5xx 做最多 3–4 次退避。
- 换同家族模型只作为诊断实验,不能当作长期绕过额度的方法。
- 在控制台核对实际 Token、倍率和余额,再决定是否调整预算。
如果网关完全没有请求记录,先查 Base URL、代理和 DNS;如果网关有记录但上游返回 429,则把脱敏后的请求 ID 提交给支持人员。
4. 建立自己的小型验证矩阵
为每个候选模型准备同一组输入:中文总结、代码修复、结构化 JSON 和长上下文各一条。记录首字时间、总耗时、输入/输出 Token、是否按预期返回 JSON,以及连续三次的稳定性。不要把一次成功截图当成 SLA,也不要把社区单个用户的价格或并发当成本站固定承诺。
5. 常见问题
国产模型能用 OpenAI SDK 吗?
本站对已开放的模型提供 OpenAI 兼容接口,通常只需统一 Base URL、Bearer Key 和模型代号;原生工具调用或特殊字段仍需按具体页面说明。
DeepSeek 429 是余额不足吗?
不一定。TPM、并发、模型容量和账户余额是不同层级,先看错误正文和控制台请求记录。
应该一次接入所有国产模型吗?
不建议。先选一个主模型和一个回退模型,用同一验证矩阵比较,再按预算和任务增加分组。
社区证据:某社区 的 API 中转与 Gemini 讨论用于归纳“统一接口、模型代号、上游限流”的共性问题;DeepSeek 限流案例来自公开 GitHub Issues。价格、模型能力和可见代号以本站控制台与官方文档为准。