商用模型还是开源模型当「老师」:OpenMAIC 课堂大模型选型横评
【免费下载链接】OpenMAICOpen Multi-Agent Interactive Classroom — Get an immersive, multi-agent learning experience in just one click项目地址: https://gitcode.com/GitHub_Trending/op/OpenMAIC
OpenMAIC(Open Multi-Agent Interactive Classroom)把「一句话生成一门互动课」做成了开源工程:输入一个主题,多智能体协同生成幻灯片、测验、互动模拟与 PBL 项目,AI 老师与 AI 同学还能在课堂上实时问答、上白板演算、开口讲解。但大多数人没有意识到,这条生成管道的每一环都是一场对模型能力的极限压力测试——大纲规划要遵循格式,场景内容要输出结构化 JSON,讲台动作要从 JSON 数组里解析出wb_draw_latex、play_video这类带参数的调用。模型选错了,课堂生成的失败率会以指数级放大。
本文基于仓库源码与社区实操情报,围绕三条主线做一次「课堂场景大模型选型横评」:指令遵循与函数调用稳定性为什么是第一指标;GPT-4/Claude 与 Qwen/GLM 在课堂内的真实差异;以及在成本、中文适配与隐私约束下,如何用 OpenMAIC 的分阶段路由机制做出折中选择。
课堂生成是对模型最苛刻的「压力测试」
打开 课程模型配置,可以看到一条固定的生成管线:文档解析(doc-parse)→ 联网调研(web-research)→ 大纲规划(outline)→ 智能体角色生成(agents)→ 场景内容(scene-content)→ 场景动作(scene-actions)→ 语音合成(tts)→ 互动编排(interaction)→ 媒体生成(media)。v1.1.0 起,设置页围绕这条工作流重构,为每个生成环节提供独立的模型选择(README.md)。
这意味着选型不是「选一个大模型」,而是要为九个不同性质的环节分别挑选。doc-parse要的是长文档抽取的耐心,scene-content要的是知识密度与表达,scene-actions要的是「看了内容之后正确决定先讲哪一页、要不要开白板」的规划力,tts则根本不走 LLM。任何一个环节的模型掉链子,整堂课就会卡壳。
指令遵循与函数调用稳定性:选型的关键指标
社区多篇实操文章反复把「指令跟随与函数调用稳定性」列为课堂场景选型的首要指标,这与源码中的机制完全吻合。OpenMAIC 的课堂互动依赖模型输出结构化动作序列:动作从模型响应的 JSON 数组项中解析(tool-schemas.ts),随后被注入系统提示词。以白板动作为例,模型必须精确产出带参数的对象:
wb_draw_latex: Add a LaTeX formula to the whiteboard. Use for mathematical equations and scientific notation. Parameters: { latex: string, x: number, y: number, width?: number, height?: number, color?: string, elementId?: string } wb_draw_chart: Add a chart to the whiteboard. Parameters: { chartType: "bar"|"column"|"line"|"pie"|"ring"|"area"|"radar"|"scatter", x, y, width, height, data: { labels: string[], legends: string[], series: number[][] }, ... } play_video: Start playback of a video element on the current slide. Synchronous — blocks until the video finishes playing. ...这类调用的失败模式非常典型:模型不遵循格式输出自然语言而非 JSON、参数类型错误、坐标超出白板边界、该聚焦时一次调用十个 spotlight。任何一个错误都会让课堂演出「穿帮」。
源码层面,所有 LLM 调用统一收口到 callLLM / streamLLM,这层封装承担了三件事:按模型的 thinking 能力注入厂商特定的请求参数、记录每次调用的 token 用量、以及空输出兜底。对于「输出为空」这类静默失败,只要配置了兜底模型就会再给一次机会;但内容安全拒绝(content-filter)永远不会触发兜底,因为换个模型重试同样会被拒,只会白白烧掉配额。
因此在筛选模型时,第一张检查表就是厂商能力清单(providers.ts)里的capabilities.tools标志——它直接表明该模型是否宣称支持工具/函数调用。有意思的是,即便是同一厂商,不同型号的工具能力也可能不一致(例如 Atlas Cloud 渠道下的 Qwen3.5 Flash 标注为tools: false,而同渠道的 DeepSeek V4 Pro 为tools: true且经过强制函数调用实测验证)。买「工具调用稳定」而不是买「品牌」,这是横评的第一个结论。
GPT-4/Claude 与 Qwen/GLM 同课堂实测对比
把商用闭源(OpenAI GPT、Anthropic Claude、Google Gemini)与开源系(Qwen、GLM、DeepSeek、Kimi)放在同一课堂里对比,仓库目录给出了四个硬维度。
上下文长度。OpenMAIC 的课堂是长会话:生成阶段要吞吐整个大纲,互动阶段 Pi 运行时还要在 128,000 token 的默认窗口内做有损压缩(director-compaction.ts,预留 20% token、保留最近 25% 消息)。这一代主流旗舰均已跨过 1M 门槛:GPT-5.6 家族 1.05M、Claude Opus 5 的 1M、DeepSeek V4 Pro 的 1,048,576、Qwen3.7 Plus/Max 与 GLM-5.3 的 1M。差距不再在「够不够长」,而在压缩策略的配合:MODEL_ROUTES允许运营者为特定环节覆盖目录里的 contextWindow 数值,把 Pi 的压缩阈值钉在一个更保守的窗口上。
思维链(thinking)的可控性。这是商用与开源系分化最明显的地方(model-metadata.ts):
- Claude 采用 effort 控制,可显式关闭或调节预算;
- DeepSeek V4 系列同样暴露 effort 档位;
- Qwen3.7 Plus/Max 的思维链可按预算开关,而 Qwen3.6 Max Preview 出厂默认关闭;
- GLM-5.3 则是「思维链不可关闭,只能低/高/最大三档缩放」,API 直接拒绝
disabled。
对课堂编排者来说,thinking 不可关的模型意味着每次互动问答都会额外产出推理 token——成本与延迟双升;但反过来,对需要深度推理的教学内容(如数学推导、PBL 方案设计),强制思考反而是质量保证。能否按环节开关思维链,直接决定了「同一个模型能否同时胜任大纲规划与课堂闲聊」。
多模态与视觉。GLM-5.3-Flash 是原生多模态型号(320B MoE、18B 激活),GLM-5.3 本身无视觉但 Flash 具备;Qwen3.7 Plus 同时点亮 tools 与 vision。课堂里「AI 老师看图讲解、批改手写白板」这类能力,只有 vision 型号才能承接。
老师层与学生层的分层。社区实操普遍采用「老师层 + 学生层」的分层选型:老师角色(大纲、讲解、答疑)上旗舰,学生角色(提问、讨论、质疑)上廉价高速型号。OpenMAIC 的机制恰好支持这种错配:Pi 运行时按 agent 角色分别管理上下文,pbl-chat与pbl-v2-runtime这类下游环节会继承父环节的模型解析结果,运营者可以在MODEL_ROUTES里把「老师发言」与「同学提问」路由到不同价位的模型,而不是让所有角色共享一个贵模型。
成本、中文适配与隐私约束下的折中选择
横评的第三部分是约束条件下的妥协。OpenMAIC 的杀手锏是分阶段模型路由(model-routes.ts):一个 JSON 环境变量即可把生成环节映射到任意provider:model,还能附带完整 thinking 配置,例如:
DEFAULT_MODEL=openai:gpt-5.4-mini MODEL_ROUTES='{ "scene-content": "openai:gpt-5.4", "pbl-chat": {"model": "anthropic:claude-sonnet-4", "thinking": {"enabled": false}}, "pbl-v2-runtime": "deepseek:deepseek-v4-pro" }' MODEL_FALLBACK='qwen:deepseek-v4-pro'MODEL_FALLBACK提供全局兜底,配合 llm-fallback.ts 的触发条件——只有可重试的失败(429 配额、5xx 容量、网络错误、空输出)才会切到第二个模型,内容安全拒绝与鉴权 4xx 永不触发。这套设计的工程含义是:你可以把最贵的商用模型只留给「内容质量最敏感」的环节(场景内容),把其余环节交给开源系廉价型号,并让一个便宜模型在故障时兜底,配额永远不会被「重试一次同样被拒的请求」浪费。
中文课堂适配是另一个被社区反复提及的维度。GLM 与 Qwen 在目录中提供双端点:GLM 同时支持国内open.bigmodel.cn与国际api.z.ai两个 baseUrl(providers.ts),Qwen 走阿里云 DashScope 兼容模式。对面向 K12 与职业教育的团队,中文语料的指令遵循、成语俗语与学科术语表达,是闭源商用模型本地化效果之外的硬成本因素——而 GLM/Qwen/DeepSeek 系的 API 价格通常低一个数量级。
隐私约束则指向另一条分支:OpenMAIC 原生支持 Ollama 与 Lemonade(本地 LLM/图像/TTS/ASR 四合一,无需 API Key)、FunASR(本地语音识别,SenseVoiceSmall/Paraformer)等本地通道(README.md)。对数据不能出校门的中小学与职业院校,「老师层用云端旗舰、学生层与语音走本地」是当前唯一既合规又可落地的组合。此外,小米 MiMo、TokenDance、豆包等 Token Plan 渠道也在目录中,属于「充值卡式」的固定成本选择,适合课堂使用量稳定的团队。
结论:没有最好的模型,只有最合适的「分诊」
把三个指标叠起来,可以给出一个务实的选型矩阵:
| 场景 | 推荐组合 | 依据 |
|---|---|---|
| 内容质量敏感(场景内容、大纲) | GPT-5.x / Claude Opus 或 Sonnet | 指令遵循与长文本结构输出最稳 |
| 中文课堂、成本敏感 | Qwen3.7 / GLM-5.3 / DeepSeek V4 | 1M 上下文、中文语料优势、thinking 可调 |
| 互动问答与课堂闲聊 | Qwen Flash / GLM Flash / 本地开源系 | 延迟优先,关闭 thinking 省 token |
| 数据不出校 | Ollama / Lemonade / FunASR 全本地 | 隐私合规,牺牲生成质量换可控性 |
OpenMAIC 把选型从「拍脑袋定一个主模型」变成了「写一张 MODEL_ROUTES 路由表」——路由即策略,兜底即容灾,分阶段即成本控制。商用模型与开源模型从来不是二选一的对立,而是在同一条课堂生成管道里各司其职。真正决定课堂质量的,不是模型的品牌,而是你是否为每一个环节配对了合适的「老师」。
【免费下载链接】OpenMAICOpen Multi-Agent Interactive Classroom — Get an immersive, multi-agent learning experience in just one click项目地址: https://gitcode.com/GitHub_Trending/op/OpenMAIC
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考