8 月 3 号晚上刷手机,看到阿里发了 Qwen3.8-Max,第一反应是:又来一个刷参数的。
结果往下翻,我愣住了。
2.4T 总参数、95B 激活的 MoE、1M 上下文,这些都好说。真正离谱的是那个演示:阿里让 Qwen3.8 从空文件夹出发,自己搭一个自进化智能体框架,16 天里自主提交了 265 次代码、127 个合并请求、151 个议题,然后开源了——项目叫 oh-my-cli,官方原话是"Hermes Agent 级别"。
我自己每天就跑在 Hermes Agent 上,看到这句差点没绷住。
更没想到的是后面那句:Max 旗舰下周首次开放权重,还附赠一个 27B 的小号。这篇文章不吹发布会,就聊聊 Qwen3.8-Max 到底改了什么、开发者怎么接 API、以及我这些年接大模型 API 踩过的坑,哪些换到它身上还会再踩一遍。
1. 背景与痛点:2T 俱乐部,国产模型的新门槛
先摆事实(来源:阿里官方发布口径,经甲子光年、CNMO 等媒体报道,2026-08-03):
- 8 月 3 日,阿里千问正式发布 Qwen3.8-Max,总参数 2.4T,是继 Kimi K3 之后国产大模型"两万亿俱乐部"的第二位成员;
- 编程(Coding)和专业办公(Cowork)是这次的主攻方向;
- 当天 Arena 榜单更新,阿里 Qwen 系列仅次于 Anthropic 的 Claude 系列,文本第二、视觉第二、编程第三。
对开发者来说,这背后是一串现实问题。
模型越来越像"人"了,但我们的工具链还没跟上。前两年 AI 编程还停留在"补全函数、改 bug"的阶段,现在旗舰模型直接奔着"从零交付一个完整项目"去。我 7 月用某闭源模型跑过一个 10 小时的长任务,跑到第 8 小时开始上下文漂移,后面全在胡说。长程任务就是 2026 年大模型的试金石——单轮对话大家都强,连跑几十轮工具调用还能不能稳住,是另一回事。
阿里这次明显是照着这个痛点打的。API 里 reasoning_effort 分 xhigh / medium / low 三档,几乎是照着 Claude Code、Codex 这类 CLI 工具的使用场景设计的(来源:知乎技术答主实测分析)。
2. 技术原理:2.4T 怎么塞进 95B 的显存里
Qwen3.8-Max 基于 Qwen 3.5 架构构建,稀疏 MoE 加混合注意力机制(来源:CNMO 科技、甲子光年)。
核心数字就两个:总参数 2.4T,激活参数 95B。激活率大概 4%,比 Qwen3-235B 那代接近 10% 的激活率又稀疏了一倍多(来源:知乎技术答主测算)。意思是,95B 激活对应的显存和算力开销,跟一个中等规模的稠密模型差不多,但它背后顶着一个 2.4T 的知识库。不用买一整个 H100 集群,几张卡加合理的 offload 策略就能转起来。
flowchartLRA[输入Token]-->B[Router门控网络]B-->C{该激活哪些专家}C-->D[专家组A<br/>代码/数学推理]C-->E[专家组B<br/>通用世界知识]C-->F[专家组C<br/>多模态理解]C-->G[...共2.4T总参数<br/>每次只激活95B]D-->H[加权融合输出]E-->HF-->HG-->HH-->I[下一个Token]MoE 的原理不复杂:把模型拆成几百个"专家",每次只让最相关的几个干活,Router 门控网络负责派活。难的是训练和推理的工程——专家负载不均衡会崩,通信开销会吃掉收益。阿里能把激活率压到 4% 还保住推理速度,说明稀疏化这块是真下了功夫。
上下文这次直接拉到 1M Tokens(来源:官方发布口径)。什么概念?完整读 200 页财报 PDF,或者分析超 100 小时的视频内容。还支持原生多模态输入——文本、图像、视频一起喂。
另外一个关键设计:API 同时兼容 OpenAI 和 Anthropic 两套协议(来源:知乎技术答主实测)。这意味着 Claude Code、Qoder、OpenClaw 这些生态可以无缝迁过来。这个点太重要了,实战部分细说。
3. 环境准备:接 API 前先搞清楚这些参数
(来源:官方发布口径 + 千问控制台公开信息,截至 2026-08-05)
| 项 | 值 |
|---|---|
| 模型 | qwen3.8-max(具体 ID 以千问控制台为准) |
| 上下文 | 1M Tokens |
| 推理档位 | reasoning_effort: xhigh / medium / low |
| 协议 | OpenAI 兼容 + Anthropic 兼容 |
| Python SDK | openai>=1.40(本文验证 2.24.0)/ anthropic>=0.40(本文验证 0.87.0) |
| 国内定价 | 输入 12 元/百万 Tokens,输出 36 元/百万 Tokens,隐式缓存命中 1.5 元/百万 Tokens |
注意:文章写作时 Qwen3.8-Max 权重还没开放(官方口径:下周开源 Max 和 27B),本地部署先别急,API 是现在唯一能跑通的路径。
环境装一下:
pipinstall-U"openai>=1.40"anthropic4. 实战实现:两种协议,三段代码
先说结论:能用 OpenAI 协议就别折腾 Anthropic 协议,除非你本来就住在 Claude Code 里。
OpenAI 协议调用,最稳的路径:
fromopenaiimportOpenAIclient=OpenAI(api_key="sk-xxxxxxxx",# 千问控制台/阿里云百炼获取base_url="https://dashscope.aliyuncs.com/compatible-mode/v1",)resp=client.chat.completions.create(model="qwen3.8-max",# 具体 model ID 以千问控制台为准messages=[{"role":"system","content":"你是资深 Python 工程师,回答问题直接、准确。"},{"role":"user","content":"下面这段代码有个并发 bug,找出来并修复:\n""import threading\n""counter = 0\n""def inc():\n"" global counter\n"" for _ in range(100000):\n"" counter += 1\n""ts = [threading.Thread(target=inc) for _ in range(10)]\n""[t.start() for t in ts]\n""[t.join() for t in ts]\n""print(counter)"},],reasoning_effort="medium",# xhigh / medium / low 三档temperature=0.3,)print(resp.choices[0].message.content)带工具调用,Agent 场景必备:
fromopenaiimportOpenAIclient=OpenAI(api_key="sk-xxxxxxxx",base_url="https://dashscope.aliyuncs.com/compatible-mode/v1",)tools=[{"type":"function","function":{"name":"get_stock_price","description":"查询指定股票代码的当前价格","parameters":{"type":"object","properties":{"symbol":{"type":"string","description":"股票代码,如 600519"}},"required":["symbol"],"additionalProperties":False,},},}]resp=client.chat.completions.create(model="qwen3.8-max",messages=[{"role":"user","content":"帮我查一下贵州茅台的股价"}],tools=tools,reasoning_effort="low",# 工具调用场景用 low/medium,省 token)print(resp.choices[0].message.tool_calls)Anthropic 协议,给 Claude Code 和已有 Anthropic SDK 的工程:
fromanthropicimportAnthropicclient=Anthropic(api_key="sk-xxxxxxxx",base_url="https://dashscope.aliyuncs.com/api/v2/apps/anthropic",# 以千问控制台文档为准)resp=client.messages.create(model="qwen3.8-max",max_tokens=4096,system="你是资深 Python 工程师。",messages=[{"role":"user","content":"解释一下 MoE 的负载均衡损失,控制在 200 字内。"}],)print(resp.content[0].text)三段代码我都用本机 Python 3.11 加 openai 2.24.0 / anthropic 0.87.0 做过语法级验证,可以直接跑;base_url 和 model ID 以你控制台实际拿到的为准,别照抄我注释。
5. 效果验证:基准数据怎么看
先说清楚:我手上没有千问的 API key,这篇不装"我实测了"。以下全是已公开的官方和第三方口径(来源:阿里官方发布、甲子光年、CNMO、知乎答主整理,2026-08-03):
| 基准 | Qwen3.8-Max | 参照 | 说明 |
|---|---|---|---|
| PaperBench | 93.0 | Fable 5 为 88.8 | 编程智能体评测新高,较上代提升 28.2 分 |
| SWE-bench Pro | 67.7 | 超 GPT-5.6 Sol,略低于 Opus 4.8 | 真实仓库修 bug |
| FrontierSWE | 73.5 | — | 更长程的编程任务 |
| CoWorkBench | 74.8 | 对标 75.9 | 办公 Agent 场景,基本追平 |
| WideSearch | 81.9 | 对标 81.2 | 深度搜索,打平 |
| OSWorld-Verified | 86.1 | 主流模型首位 | 电脑操作 Agent |
| GPQA Diamond | 92.6 | — | 科学推理 |
| IF Bench | 82.8 | — | 指令遵循 |
注意分数的口径差异:PaperBench 考的是"给一篇论文,复现并超越",OSWorld 考的是"操作电脑完成任务",SWE-bench 考的是"在真实仓库上修 bug"。不是一个维度的东西,别拿一张表排总名次。
定价维度(来源:官方发布口径):
| 项 | Qwen3.8-Max(国内) | 对比 |
|---|---|---|
| 输入 | 12 元/百万 Tokens | 国际价为 Opus 5 的 40% |
| 输出 | 36 元/百万 Tokens | 国际价为 Opus 5 的 24% |
| 隐式缓存命中 | 1.5 元/百万 Tokens | 长上下文场景优势明显 |
我的判断:单看分数,Qwen3.8-Max 是追平或小幅超过,不是碾压。真正值得关注的是长程任务能力——CoWorkBench、WideSearch、OSWorld 这些几十轮交互的测试它都站在第一梯队,这恰恰是开源模型过去最拉胯的地方(开源模型跑 SWE-bench 单点还行,跑到第十轮工具调用就开始飘,知乎答主原话)。
6. 踩坑记录:接 API 的老毛病,换模型也躲不掉
说几个我接大模型 API 踩过的坑,换到 Qwen3.8 上大概率还会再遇到:
坑 1:SDK 版本太老,参数被吞。openai SDK 1.x 时代 reasoning_effort 这类新参数经常直接报 unexpected argument,或者悄悄被忽略。别用系统自带的老版本,pip 装到最新再联调。
坑 2:base_url 拼错,404 找半天。OpenAI 兼容端点是 /v1 结尾,多一个斜杠少一个斜杠都报错。先请求一下 /models 接口验通,再写业务代码。
坑 3:tool calling 的 schema 太宽松。parameters 里不写 additionalProperties: False,模型就会自作主张加字段,下游解析直接崩。这个在 GPT、Claude、Qwen 上我都遇到过。
坑 4:1M 上下文不等于可以无脑塞。长上下文计费是线性的,隐式缓存命中 1.5 元看着便宜,但缓存不命中的时候输入 12 元/百万——一次塞 500K token 的 prompt,光输入就 6 块。长任务自己做好分段和摘要,别把模型当无限内存。
坑 5:双协议是便利也是坑。OpenAI 协议和 Anthropic 协议的 message 结构完全不一样:roles 的写法、system 的位置、tool_calls 的格式。同一套服务端逻辑接两套协议,等于维护两份适配层。能用一套就别上两套。
7. 总结与展望
Qwen3.8-Max 这次最值得记住的不是 2.4T 这个数字,是三件事:长程任务能力站上第一梯队、API 双协议把迁移成本打下来、Max 旗舰首次开源(下周)。
如果下周权重真放出来,开源社区的天花板会被抬到 2.4T 这个量级。DeepSeek 把"闭源溢价"这层窗户纸戳穿之后,阿里选择用开源生态锁住上下游,这一步棋对开发者是实打实的好事。
泼盆冷水:基准分和真实体感是两回事。等开源权重落地,本地部署的显存需求、推理速度、量化方案全是新问题;API 的稳定性和限流策略也要真实流量检验。别急着把生产环境全切过去。
最后留个问题:你现在主力用哪家模型写代码?Qwen3.8-Max 下周开源之后,你会考虑本地部署还是继续用 API?评论区聊聊,有已经在千问平台上跑过 Qwen3.8 的,也说说真实体感——我第一次写这个方向,有不准确的地方欢迎指正。
数据来源:阿里官方发布口径(2026-08-03);甲子光年《阿里Qwen3.8正式发布,编程与办公再进化》(2026-08-03);CNMO 科技(2026-08-03);凤凰网大风号、网易号转载(2026-08-03);知乎「如何评价8月3日上线的阿里Qwen 3.8 Max正式版?」高赞答主实测分析(2026-08-04)。文中所有基准分数均为第三方公开口径,本人未实测模型本体;接入代码经本机语法级验证。