前言
后台经常收到一类问题:“到底该用哪个模型?”——GPT-4o 贵但全面、Claude 会写会推理、Gemini 长文本便宜、DeepSeek 性价比怪物。网上的评测大多基于公开 benchmark,但 benchmark 分数和我们实际干活的感觉经常对不上。
所以我做了个更接地气的测试:用同一套真实工作任务,让四家模型同台竞技。因为四个模型都在我的聚合网关端点里(见系列前三篇),整个测试只需要换model参数,公平性反而比分别调四家官网 API 更好(相同 temperature、相同 prompt、同一套计费口径)。
一、测试设置
参赛选手(都是当时的主力型号,价格以模型广场实时价为准):
| 选手 | 定位印象 |
|---|---|
gpt-4o | 全能六边形战士,行业标杆 |
claude-sonnet-4-5 | 写作与复杂推理的口碑王 |
gemini-2.5-pro | 长上下文怪物,百万 token 窗口 |
deepseek-reasoner | 性价比与推理深度的国产黑马 |
测试项(都是日常开发中真实会遇到的):
- 代码生成:写一个带重试与超时的 HTTP 客户端封装(Python)
- 代码审查:找出一段含 3 个 bug 的并发代码
- 中文长文写作:写一篇 800 字的技术短文,要求观点清晰
- 长上下文理解:投喂 3 万字文档后回答细节问题
- 成本效率:各模型完成同样 10 个任务的账单对比
二、结果速览(方向性结论)
以下是我测试时段的方向性观察,模型迭代很快,结论仅供参考,请以你自己的实测为准。
代码生成:Claude 和 GPT-4o 领跑,DeepSeek 惊艳
Claude 的代码风格最"工程化"——类型注解、异常处理、重试逻辑全都主动写好,基本拿到就能用。GPT-4o 稳定但中规中矩。最大的惊喜是 DeepSeek:核心逻辑正确率与两家旗舰几乎无差,价格只有零头——这也解释了为什么它成了我轻量任务路由的默认选项。
代码审查:推理型模型碾压
给 3 个并发 bug,deepseek-reasoner和 Claude 找全了,GPT-4o 漏了 1 个。结论:审查类任务必须用推理模型,这类任务占预算的比例应该提高。
中文写作:国产模型的母语优势
DeepSeek 和通义的中文行文最自然;Claude 结构感强但偶有翻译腔;GPT-4o 中规中矩。中文内容生产场景,国产模型已经是优选,不是"平替"。
长上下文:Gemini 的主场
3 万字文档的细节问答,Gemini 稳定发挥(毕竟窗口摆在那),Claude 表现同样出色,GPT-4o 和 DeepSeek 会丢失中段细节。处理长文档直接选长窗口模型,别硬塞。
成本:差距比性能差距大得多
完成同样 10 个任务,各模型的账单差距在10~30 倍之间。这引出了本次测试最重要的结论:
“哪个模型最强"是个伪问题,正确的问题是"每个环节该用哪个模型”。
三、所以我的最终配置是
跑完这轮测试,我把项目的模型分配改成了这样(在聚合网关下一个 Key 全搞定):
| 环节 | 模型 | 理由 |
|---|---|---|
| Agent 规划、代码审查 | claude-sonnet-4-5 / deepseek-reasoner | 推理深度优先 |
| 日常代码生成 | gpt-4o / deepseek-chat | 质量与速度平衡 |
| 中文内容生产 | deepseek-chat | 母语优势 + 便宜 |
| 长文档分析 | gemini-2.5-pro | 长窗口刚需 |
| 批量摘要/分类等杂活 | deepseek-chat | 便宜到可以忽略 |
按这个配置跑了一个月,账单只有"全旗舰方案"的约 15%,质量几乎没有损失。
四、怎么复现我的测试
如果你想在同样的口径下跑一轮自己的横评(强烈建议,别人的结论永远不如自己的数据),接入很简单——任何 OpenAI 兼容端点都行,我是通过 Rqu AI 的聚合网关做的:注册后创建一个 Key,测试脚本里只改model参数,四家模型的请求格式完全一致,连结果解析代码都只写一份。
formodelin["gpt-4o","claude-sonnet-4-5","gemini-2.5-pro","deepseek-reasoner"]:resp=client.chat.completions.create(model=model,messages=case,**same_params)log_result(model,resp)对比测试的核心是控制变量:同参数、同 prompt、同计费口径。分散在四家官网测,光是对齐计费口径就够你喝一壶的。
五、结论
- 没有全能冠军,只有场景最优解;
- 代码审查/推理 → 推理模型;中文写作 → 国产模型;长文档 → 长窗口模型;
- 成本差距(10~30 倍)远大于质量差距(百分之几十),选型省下的钱比优化代码省下的钱多;
- 想自己跑横评,聚合到一个端点是控制变量最省事的方式。
测试脚本和任务集我会整理后开源,欢迎关注。