news 2026/10/10 16:30:03

NeoHorse-1适合你吗?从个人助理到工具调用的智能体模型场景选型指南

作者头像

张小明

前端开发工程师

1.2k 24
文章封面图
NeoHorse-1适合你吗?从个人助理到工具调用的智能体模型场景选型指南

【免费下载链接】NeoHorse

NeoHorse-1: Towards Recursive Self-Improvement via Agentic Post-Training with Routing Harness.

项目地址:https://gitcode.com/gh_mirrors/ne/NeoHorse
点击查看免费下载

NeoHorse-1是由 TokenRhythm 开源的智能体原生(Agent-Native)因果语言模型家族,提供 4B 和 9B 两种规格,专为个人助理、工具调用(Tool Calling)、编码与指令遵循场景设计。本文用 5 分钟帮你搞清楚:NeoHorse-1 适合谁、4B 和 9B 怎么选、以及如何在本地跑起来。

一、NeoHorse-1 是什么?为什么值得关注

NeoHorse-1 不是一般的聊天模型,它是一系列在"智能体后训练"(Agentic Post-Training)路径上打磨出来的智能体模型:

  • 出身:基于 Qwen3.5-4B 和 Qwen3.5-9B 做后训练,原生支持 262,144 token 上下文
  • 定位:文本输入 / 文本输出,面向本地自部署(self-hosted)
  • 协议:Apache 2.0 开源许可,商用友好(见 LICENSE)

它最特别的地方在于背后的Routing Harness(路由框架):框架把任务分派给不同模型池,记录工具调用轨迹和结果,再把"能力反馈"喂回下一轮训练数据,形成一个"评估 → 选择 → 更新"的原型闭环,是通往递归自我改进(RSI)的初始原型。

📄 完整方法论可查阅仓库中的技术报告:TechnicalReport_NeoHorse_v1.pdf

二、两大核心卖点:智能体能力与指令遵循

2.1 智能体(Agentic)任务表现

NeoHorse-1 在个人助理类基准(PinchBench、VitaBench、WorkBuddy Bench、tau2-Bench 等)上表现突出。以 4B 为例,它在 PinchBench 上拿到77.3分、tau2-Bench 上拿到88.5分,均超过同规格基线 Qwen3.5-4B。

2.2 9B 版的更高天花板

9B 版本在同样基准上进一步提升,例如 PinchBench 达到82.3、tau2-Bench 达到90.8、BFCL v4(工具调用基准)达到67.4,十项基准平均分 69.04,是 9B 档位开源模型中的第一梯队。

三、场景选型指南:4B 还是 9B?

这是本文的重点。不同场景下的推荐如下:

你的场景推荐规格理由
🖥️ 消费级 GPU / 边缘设备本地部署4B部署足迹轻,8-bit 量化后单机即可流畅运行
🤖 个人助理 / 日常问答 Agent4B十项基准均分 64.87,指令遵循已很能打
🛠️ 复杂工具调用 / 多步骤任务编排9BBFCL v4、tau2-Bench 等工具调用基准显著领先
💻 代码补全与编码 Agent9BHumanEval 98.17,编码能力上限更高
📚 企业级私有化部署(数据不出域)9B容量更高,同等文本接口下综合表现更强

3.1 硬件不够?选量化版本

4B 和 9B 均提供16-bit(BF16)及 8-bit / 5-bit / 4-bit 量化版本(GGUF 格式),量化版占用更少的磁盘和显存,让普通玩家更容易在自有硬件上运行 NeoHorse 智能体模型;Apple 芯片用户还可选择 MLX 版本。

3.2 快速决策口诀

  • 显存紧张、追求轻快→ NeoHorse-1-4B
  • 能力优先、显存充足→ NeoHorse-1-9B
  • 两个都想试→ 先 4B 验证流程,再上 9B 提能力

四、工具调用实战:让模型自己"动手"

NeoHorse-1 原生支持 OpenAI 兼容的工具调用协议。仓库提供了开箱即用的示例脚本,几乎零代码即可体验:

  • 对话示例:examples/chat.py —— 向部署好的模型发送"你是谁?",开启思考模式返回完整回复
  • 工具调用示例:examples/tool_call.py —— 询问"北京现在天气怎么样?",模型自动调用get_current_weather工具函数,返回结构化的 tool_call

运行方式非常简单,以对话示例为例:

python examples/chat.py \ --url http://127.0.0.1:8000 \ --model neohorse-1-4B

👉 也就是说,把它接入自己的 Agent 应用,只需要一个标准 API 端点,无需额外改造。

五、一键部署:最快上手步骤

  1. 下载权重:从 Hugging Face 或 ModelScope 拉取 NeoHorse-1-4B / 9B 权重(含 GGUF 量化版)
  2. 选择推理框架:SGLang 或 vLLM 均可,关键参数见 README.md 的 Deployment 章节:
    • SGLang:--reasoning-parser qwen3+--tool-call-parser qwen3_coder
    • vLLM:--enable-auto-tool-choice+--tool-call-parser qwen3_coder
  3. 验证服务:跑一遍examples/chat.py和examples/tool_call.py,确认对话与工具调用都正常
  4. 接入你的应用:任何 OpenAI 兼容客户端(/v1/chat/completions)都能直接使用

⚠️ 262,144 token 是配置上限,实际可用长度取决于 GPU 显存,显存不足时请调小--context-length/--max-model-len。

六、常见问题(FAQ)

Q1:NeoHorse-1 和普通聊天模型的最大区别是什么?A:它经过"路由引导的智能体后训练"(routing-guided agentic post-training),训练信号直接来自真实执行轨迹和工具调用结果,因此在个人助理、工具调用这类多步骤任务上更强。

Q2:4B 和 9B 接口一致吗?A:完全一致,都是文本输入 / 文本输出的标准服务接口,切换规格只需换权重和服务别名(neohorse-1-4B/neohorse-1-9B)。

Q3:可以商用吗?A:可以,NeoHorse-1 以 Apache 2.0 协议发布。

七、总结:NeoHorse-1 到底适合你吗?

✅ 适合你,如果你:想用本地部署构建智能体应用、重视工具调用可靠性、需要 Apache 2.0 许可的开源智能体模型; ❌ 不适合你,如果你:需要多模态(图像输入输出)能力,或期望零配置的云端 API。

一句话选型:轻部署选 4B,强能力选 9B,两者共享同一套"智能体后训练"血统,是目前开源小参数智能体模型中非常值得试水的一组选择。更多评测细节可查阅 README.md 中的完整基准表格与技术报告 TechnicalReport_NeoHorse_v1.pdf。

【免费下载链接】NeoHorse

NeoHorse-1: Towards Recursive Self-Improvement via Agentic Post-Training with Routing Harness.

项目地址:https://gitcode.com/gh_mirrors/ne/NeoHorse
点击查看免费下载

相关推荐

创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

版权声明: 本文来自互联网用户投稿,该文观点仅代表作者本人,不代表本站立场。本站仅提供信息存储空间服务,不拥有所有权,不承担相关法律责任。如若内容造成侵权/违法违规/事实不符,请联系邮箱:809451989@qq.com进行投诉反馈,一经查实,立即删除!
网站建设 2026/10/10 16:27:46

第四章 JUC 常见并发工具类(java.util.concurrent,面试核心)

定位:JUC是Java标准库提供的并发编程工具包,包含任务封装、可重入锁、原子类、线程池、同步工具等,比原生synchronized更灵活、功能更强。1. Callable 接口 FutureTask解决的问题Runnable 的 void run() 没有返回值,也不能抛出受…

作者头像 李华
网站建设 2026/10/10 16:27:12

人脸识别系统毕设全流程:从数据集采集到门禁落地避坑指南

简介:面向毕业设计场景的人脸识别系统资源包,系统覆盖计算机视觉、图像处理、模式识别与深度学习多条技术线。包内不仅提供从开题报告、摘要到详细设计说明的完整文档,还包含可运行的C工程与人脸数据库,内置人脸检测、特征提取与匹…

作者头像 李华
网站建设 2026/10/10 16:22:01

Java集合Set详解:HashSet去重、LinkedHashSet保序与TreeSet排序

1. 整体设计与思路拆解:Set到底在解决什么问题聊到Java集合,很多人第一反应是ArrayList、HashMap这类“用得最勤快”的容器,Set往往被一笔带过。但真正到了面试或者线上排查问题的时候,你会发现Set才是最容易翻车的那一个。不是说…

作者头像 李华
网站建设 2026/10/10 16:21:58

动态目标三维重构在要地防卫、人群异常行为研判中的应用

摘要要地防卫涵盖党政核心驻地、军事营区、枢纽场馆、战备设施、涉密点位等极高等级安防场景,核心防控对象包含外来入侵目标、近距离抵近人员、违规闯入车辆及高密度流动人群,具备防卫等级高、人员车流密集、场景开放性强、异常态势隐蔽、突发风险蔓延快…

作者头像 李华
网站建设 2026/10/10 16:20:55

RSNA肺炎检测数据集:VOC与YOLO双格式解析及训练前避坑指南

简介:RSNA肺炎检测数据集面向医学影像目标检测方向的学习者与开发者,围绕RSNA胸部影像场景整理,数据规模为6012张图片、单一类别meat、9555个目标框,适合直接用于YOLO、Faster R-CNN等主流检测框架的训练与评估。数据提供Pascal V…

作者头像 李华
网站建设 2026/10/10 16:18:29

两个正序数组找中位数:二分排除法与划分数组法详解

我一开始接触这道题的时候,觉得它就是个简单的“归并排序取中间值”问题,不就是把两个数组合并起来,然后按下标取值吗?直到我读到题目里那个O(log(mn))的时间复杂度要求,才意识到事情没那么简单。这道题是数组二分操作…

作者头像 李华