让DeepSeek V4-Flash和GPT-6 Sol整理通知、算收支,结果能用吗?
同题实测:整理通知有没有擅自分配职责,算收支有没有处理未知成本,追问后有没有真正改好。
÷2=55%,B=(80%+10%)÷2=45%:
| 要求 | DeepSeek V4-Flash | GPT-6 Sol |
|---|---|---|
| 正确重算A为55%、B为45% | 用假设人数展开,比例正确 | 直接给出正确比例 |
| 分列能确定与不能确定的事项 | 有分列,但同时使用“方法A更有效”的较强说法 | 有分列,明确不能保证换方法会提高个人达标率 |
| 不超过350字 | 576个字符,超长 | 154个字符,符合 |
图:根据真实API回答整理完成情况,非官方界面截图。
🎓 学生与💼办公用户,推荐哪个模型?
| 用途 | 本次优先推荐 | 原因 |
|---|---|---|
| 学生:需要准确、简短的解释 | GPT-6 Sol | 学习题算对,说明了结论限制,也执行了长度要求 |
| 办公:需要待办表与收支结果 | GPT-6 Sol | 未指定的职责保持待确认;成本未知时保留表达式,补齐后核算正确 |
如果只比较本题的已知金额核算,两个模型都完成了任务。涉及职责分配或严格长度限制时,本次结果支持优先选GPT-6 Sol;DeepSeek V4-Flash虽然初答较快,却没有在追问后修正自行指定的负责人。这里的推荐依据是输出是否符合要求,不是回答篇幅或表格是否整齐。
测试配置
| 配置 | DeepSeek V4-Flash | GPT-6 Sol |
|---|---|---|
| 请求标识 | deepseek-v4-flash | gpt-6-sol |
| 回传标识 | deepseek-v4-flash-0731 | gpt-6-sol |
| 推理设置 | 关闭思考 | 供应端默认 |
| 输出上限 | 3000 tokens | 3000 tokens |
| 各自回应数量与结束情况 | 6份,均正常结束 | 6份,均正常结束 |
使用相同系统指示、题目和追问文字,追问带各自的初答。非流式调用,最多四路并行;耗时含网络、网关、排队和生成。每种配置每题一次,未启用搜索、文件解析或代码执行,未独立确认上游版本映射。结论适用于本次配置,未覆盖文件上传或完整办公软件操作。
接口说明见Crazyrouter API文档。
本文使用AI协助撰写。