【免费下载链接】NeoHorse
NeoHorse-1: Towards Recursive Self-Improvement via Agentic Post-Training with Routing Harness.
NeoHorse-1是由 TokenRhythm 开源的智能体原生(Agent-Native)因果语言模型家族,提供 4B 和 9B 两种规格,专为个人助理、工具调用(Tool Calling)、编码与指令遵循场景设计。本文用 5 分钟帮你搞清楚:NeoHorse-1 适合谁、4B 和 9B 怎么选、以及如何在本地跑起来。
一、NeoHorse-1 是什么?为什么值得关注
NeoHorse-1 不是一般的聊天模型,它是一系列在"智能体后训练"(Agentic Post-Training)路径上打磨出来的智能体模型:
- 出身:基于 Qwen3.5-4B 和 Qwen3.5-9B 做后训练,原生支持 262,144 token 上下文
- 定位:文本输入 / 文本输出,面向本地自部署(self-hosted)
- 协议:Apache 2.0 开源许可,商用友好(见 LICENSE)
它最特别的地方在于背后的Routing Harness(路由框架):框架把任务分派给不同模型池,记录工具调用轨迹和结果,再把"能力反馈"喂回下一轮训练数据,形成一个"评估 → 选择 → 更新"的原型闭环,是通往递归自我改进(RSI)的初始原型。
📄 完整方法论可查阅仓库中的技术报告:TechnicalReport_NeoHorse_v1.pdf
二、两大核心卖点:智能体能力与指令遵循
2.1 智能体(Agentic)任务表现
NeoHorse-1 在个人助理类基准(PinchBench、VitaBench、WorkBuddy Bench、tau2-Bench 等)上表现突出。以 4B 为例,它在 PinchBench 上拿到77.3分、tau2-Bench 上拿到88.5分,均超过同规格基线 Qwen3.5-4B。
2.2 9B 版的更高天花板
9B 版本在同样基准上进一步提升,例如 PinchBench 达到82.3、tau2-Bench 达到90.8、BFCL v4(工具调用基准)达到67.4,十项基准平均分 69.04,是 9B 档位开源模型中的第一梯队。
三、场景选型指南:4B 还是 9B?
这是本文的重点。不同场景下的推荐如下:
| 你的场景 | 推荐规格 | 理由 |
|---|---|---|
| 🖥️ 消费级 GPU / 边缘设备本地部署 | 4B | 部署足迹轻,8-bit 量化后单机即可流畅运行 |
| 🤖 个人助理 / 日常问答 Agent | 4B | 十项基准均分 64.87,指令遵循已很能打 |
| 🛠️ 复杂工具调用 / 多步骤任务编排 | 9B | BFCL v4、tau2-Bench 等工具调用基准显著领先 |
| 💻 代码补全与编码 Agent | 9B | HumanEval 98.17,编码能力上限更高 |
| 📚 企业级私有化部署(数据不出域) | 9B | 容量更高,同等文本接口下综合表现更强 |
3.1 硬件不够?选量化版本
4B 和 9B 均提供16-bit(BF16)及 8-bit / 5-bit / 4-bit 量化版本(GGUF 格式),量化版占用更少的磁盘和显存,让普通玩家更容易在自有硬件上运行 NeoHorse 智能体模型;Apple 芯片用户还可选择 MLX 版本。
3.2 快速决策口诀
- 显存紧张、追求轻快→ NeoHorse-1-4B
- 能力优先、显存充足→ NeoHorse-1-9B
- 两个都想试→ 先 4B 验证流程,再上 9B 提能力
四、工具调用实战:让模型自己"动手"
NeoHorse-1 原生支持 OpenAI 兼容的工具调用协议。仓库提供了开箱即用的示例脚本,几乎零代码即可体验:
- 对话示例:examples/chat.py —— 向部署好的模型发送"你是谁?",开启思考模式返回完整回复
- 工具调用示例:examples/tool_call.py —— 询问"北京现在天气怎么样?",模型自动调用
get_current_weather工具函数,返回结构化的 tool_call
运行方式非常简单,以对话示例为例:
python examples/chat.py \ --url http://127.0.0.1:8000 \ --model neohorse-1-4B👉 也就是说,把它接入自己的 Agent 应用,只需要一个标准 API 端点,无需额外改造。
五、一键部署:最快上手步骤
- 下载权重:从 Hugging Face 或 ModelScope 拉取 NeoHorse-1-4B / 9B 权重(含 GGUF 量化版)
- 选择推理框架:SGLang 或 vLLM 均可,关键参数见 README.md 的 Deployment 章节:
- SGLang:
--reasoning-parser qwen3+--tool-call-parser qwen3_coder - vLLM:
--enable-auto-tool-choice+--tool-call-parser qwen3_coder
- SGLang:
- 验证服务:跑一遍
examples/chat.py和examples/tool_call.py,确认对话与工具调用都正常 - 接入你的应用:任何 OpenAI 兼容客户端(
/v1/chat/completions)都能直接使用
⚠️ 262,144 token 是配置上限,实际可用长度取决于 GPU 显存,显存不足时请调小
--context-length/--max-model-len。
六、常见问题(FAQ)
Q1:NeoHorse-1 和普通聊天模型的最大区别是什么?A:它经过"路由引导的智能体后训练"(routing-guided agentic post-training),训练信号直接来自真实执行轨迹和工具调用结果,因此在个人助理、工具调用这类多步骤任务上更强。
Q2:4B 和 9B 接口一致吗?A:完全一致,都是文本输入 / 文本输出的标准服务接口,切换规格只需换权重和服务别名(neohorse-1-4B/neohorse-1-9B)。
Q3:可以商用吗?A:可以,NeoHorse-1 以 Apache 2.0 协议发布。
七、总结:NeoHorse-1 到底适合你吗?
✅ 适合你,如果你:想用本地部署构建智能体应用、重视工具调用可靠性、需要 Apache 2.0 许可的开源智能体模型; ❌ 不适合你,如果你:需要多模态(图像输入输出)能力,或期望零配置的云端 API。
一句话选型:轻部署选 4B,强能力选 9B,两者共享同一套"智能体后训练"血统,是目前开源小参数智能体模型中非常值得试水的一组选择。更多评测细节可查阅 README.md 中的完整基准表格与技术报告 TechnicalReport_NeoHorse_v1.pdf。
【免费下载链接】NeoHorse
NeoHorse-1: Towards Recursive Self-Improvement via Agentic Post-Training with Routing Harness.
相关推荐
终极指南:7个最佳Core ML模型性能对比,帮你选择最适合的应用场景
终极指南:7个最佳Core ML模型性能对比,帮你选择最适合的应用场景 想要在iOS应用中集成机器学习功能却不知道选择哪个模型?Awesome CoreML M
文档教程SeedVR2-7B模型选型终极指南:找到最适合你的AI助手
SeedVR2 7B模型选型终极指南:找到最适合你的AI助手 还在为选择AI模型而头疼吗?🤔 面对SeedVR2 7B模型家族的多个版本,不知道哪个才是你的"
人工智能计算机视觉模型推理服务如何在10分钟内用CUBER部署应用到Kubernetes?新手友好指南
如何在10分钟内用CUBER部署应用到Kubernetes?新手友好指南 CUBER是一款简化Kubernetes应用部署的自动化工具,只需创建约10行代码的
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考