news 2026/10/12 5:50:11

Neuphonic 开源 43MB 语音决策模型 NeuDecide:不经 ASR 语音调用工具;法国 Mallow 儿童无屏语音游戏音箱,AI 听孩子语音实时推进丨日报

作者头像

张小明

前端开发工程师

1.2k 24
文章封面图
Neuphonic 开源 43MB 语音决策模型 NeuDecide:不经 ASR 语音调用工具;法国 Mallow 儿童无屏语音游戏音箱,AI 听孩子语音实时推进丨日报

本期编辑:@三水 @鲍勃

01 有话题的技术

1、端侧 AI 模型公司 Liquid AI 开放两款多模态决策模型 d1:600M 首次支持音频输入,3B 可在 Jetson 上实现毫秒级决策

Liquid AI 发布d1-3B和实验性模型d1-omni-600M,两款模型分别支持文本与图像、文本与图像或音频的组合输入。与逐 token 生成回复的 LLM 不同,d1 通过一次前向计算直接输出结构化决策结果及其概率,可用于智能体意图分类、任务路由、内容审核等场景,并支持在工作站和边缘设备上本地运行。与 NVIDIA 合作,在 Isaac Sim 中展示了 d1-3B 模型在环境中的导航能力。该模型运行在 Jetson 设备上,采用硬件在环仿真方式实现。

  • 600M 模型首次加入音频决策能力:d1-omni-600M 约有5.87 亿参数,采用共享主干网络连接视觉与音频编码器,支持最长 30 秒的语音输入。模型可以直接判断用户语音的主题、意图或请求类型,无需先转写成文字再交给 LLM 判断。目前音频能力主要针对英语语音训练,尚未公布专门的音频决策评测结果。

  • 3B 模型可在 Jetson 上实现毫秒级推理:d1-3B 基于 LFM2.5-VL-3B 训练,在 Decision Index v0.2.1 公共测试集上得分48.57。单个问题的端到端推理延迟在 RTX 4090 上为8ms,Jetson AGX Thor 为16ms,Jetson AGX Orin 为26ms,Jetson Orin Nano 为50ms。

  • 开放权重并支持本地微调和部署:两款模型均已在 Hugging Face 开放权重,并提供 llama.cpp 支持,覆盖 NVIDIA DGX、RTX 工作站及 Jetson 等设备。开发者可以根据决策准确率、模型体积和输入模态需求选择模型。

https://www.liquid.ai/blog/d1-open

2、语音 AI 公司 Neuphonic 开源 43MB 语音决策模型 NeuDecide:无需 ASR 直接生成工具调用,单线程 CPU 即可运行

Neuphonic 开源端侧语音决策模型NeuDecide,仅有5550 万参数、43MB 模型文件,可以直接将用户语音转换为工具调用的函数名称和参数,无需经过传统的 ASR 转写环节。模型基于 ONNX Runtime 运行,单线程 CPU 即可完成推理,无需 GPU 或云端服务,开发者还可以直接在浏览器演示中测试语音控制工具。

  • 语音直接映射为工具调用:NeuDecide 将预训练流式语音编码器与轻量级工具调用模型结合,直接根据音频和开发者提供的 JSON Schema 生成结构化函数调用。例如,用户说出「打扫浴室」,模型即可输出cleanRoom(room="bathroom")。工具列表可在推理时动态传入,无需为新增工具重新训练模型。

  • 43MB 模型实现毫秒级本地决策:根据官方测试,NeuDecide 在 MacBook Pro M3 上生成工具调用耗时46ms,三星 S24+ 为82ms,树莓派 5 为206ms。在 SLURP 语音指令测试中,模型的工具选择准确率达到75.5%,函数及参数完全匹配率为37.5%;作为对比,Whistle → Needle 3 串联方案分别为 25.6% 和 7.1%。

  • 开放权重与本地部署:NeuDecide 采用 Apache 2.0 许可证,提供 Python SDK、ONNX 模型及 Hugging Face 在线演示。目前支持英语、最长 30 秒音频,官方建议单次提供不超过 10 个工具。模型更适合执行范围明确的语音指令,复杂或无法识别的请求仍建议交由更大的模型处理。

https://x.com/neuphonicspeech/status/2108161404079350113

3、独立开发者 Sahil Mahendrakar 开源 8M 参数 TTS 模型 Paradee:仅 9MB,单线程 CPU 实现 18 倍实时语音合成

开发者 Sahil Mahendrakar 发布开源语音合成模型 Paradee,通过知识蒸馏将 Kokoro-82M 从约 8200 万参数压缩至 807 万参数,并将量化后的模型文件缩小至 9MB。在 Apple M4 Pro 的单线程 CPU 上,发布的 ONNX 版本无需 GPU 即可达到约 18 倍实时语音合成速度,目前支持英语单音色生成。

  • 将语音合成模型压缩至原来的约 1/10: Paradee 保留 Kokoro 的基本架构,但缩小各层宽度,将文本预测模块和音频解码器分别蒸馏。训练时利用原模型生成的音素时长、音高、能量和语音特征作为监督信号,两部分独立训练后直接组合,无需额外联合训练。

  • 9MB 模型接近原版语音质量: 在 200 条测试语句上,Paradee 的 UTMOS 语音自然度预测评分为 4.41,接近 Kokoro-82M 的 4.52。研究版本的词错误率(WER)均为 5.7%。模型还通过无需额外训练的相位校正滤波器,减少小型解码器产生的轻微杂音。

  • 支持 CPU 本地部署与浏览器运行: 项目已开放 Apache 2.0 许可的模型权重、训练代码和 ONNX 文件,可通过 Python 调用,也已用于浏览器扩展中的本地语音合成。目前仅支持 Kokoro 的af_heart英语音色,暂不支持多音色生成。

https://huggingface.co/sahilmahendrakar/Paradee-8M-v1.0

4、微软 AI 发布流式语音识别模型 MAI-Transcribe-2-Streaming:百毫秒输出初步转写,同步推出两款多语言 TTS 模型

微软 AI 发布首款流式语音识别模型MAI-Transcribe-2-Streaming,支持 60 种语言的实时转写,接收音频后约 100 毫秒即可输出初步识别结果,并随着后续语音输入持续修正。同期推出多语言语音合成模型MAI-Voice-2.1和低延迟版本MAI-Voice-2.1-Flash,覆盖从实时语音识别到语音生成的完整链路。

  • 流式 ASR 可在用户说完前输出识别结果:MAI-Transcribe-2-Streaming 支持连续语言检测,并逐步输出初步转写及最终确认文本,让 Voice Agent 能够在用户说话过程中提前启动推理或工具调用。微软表示,该模型在 Artificial Analysis 的初步转写和最终转写准确率评测中均排名第一;内部测试显示,实时字幕中的文字出现速度达到最接近竞争模型的2 倍。

  • TTS 新增跨语言保持同一声线的能力:MAI-Voice-2.1 支持23 种语言、26 个地区变体,同一个声音可以在英语、中文、德语等语言之间切换,同时保留声音身份,并采用相应语言的自然口音。模型还支持通过几秒参考音频进行跨语言声音克隆。

  • Flash 版本进一步降低语音生成延迟:MAI-Voice-2.1-Flash 面向高并发、低延迟场景,微软称其在生成最长 45 秒音频的任务中端到端延迟约150 毫秒,模型推理速度提升 55%,成本较同类模型降低约 60%。定价为每百万字符15 美元,标准版 MAI-Voice-2.1 为22 美元;MAI-Transcribe-2-Streaming 年底前的推广价格为每小时音频0.54 美元。

三款模型均已通过 Microsoft Foundry 等渠道提供,其中 MAI-Transcribe-2-Streaming 的实时 API 目前处于公开预览阶段。

https://microsoft.ai/news/our-first-streaming-transcription-model/

02 有亮点的产品

1、AI 硬件公司 Natura 发布语音智能戒指 Interface:通过语音调用多个 AI 智能体,无需拿出手机即可分配任务

Natura 发布面向 AI 智能体的智能戒指Interface,将语音输入变成调用不同 AI 智能体的统一入口。用户按住戒指上的按钮即可发出语音指令,通过配套系统 NatureOS 将任务交给 Claude、ChatGPT、Grok 等智能体执行,并在手机或耳机上接收结果。戒指还支持语音笔记、会议录音和健康数据追踪。

  • 一个戒指调用多个 AI 智能体:Interface 内置麦克风和实体按钮,用户可以通过语音指定不同智能体完成编程、行程规划、信息检索等任务。NatureOS 负责连接智能体与应用、管理访问权限,并在执行需要授权的操作前请求用户确认。任务完成后,结果可通过耳机、iPhone 锁屏通知或 NatureOS 应用返回。

  • 语音输入同时用于会议记录与个人记忆:用户可以双击按钮开始或结束较长时间的录音,将会议内容转换为笔记、决策和待办事项,也可以随时口述想法并保存。戒指采用按键触发录音的方式,不会持续监听;官方标称日常续航为6–12 天,并支持心率、睡眠和活动监测。

Interface 计划以99 美元的早期价格推出,预计于 2026 年 12 月至 2027 年 1 月期间发货。目前官网开放候补登记,最终售价和交付时间仍待确认。

https://natura.inc/interface

2、法国儿童 AI 硬件公司 Mallow 推出无屏语音游戏音箱:人类编写剧情,AI 根据儿童语音实时推动游戏

由法国前数字经济国务秘书、Mistral AI 联合创始人 Cédric O 参与创立的 Mallow,推出面向4–10 岁儿童的无屏 AI 语音游戏音箱。产品将人工编写的故事、游戏规则与生成式 AI 结合,孩子通过语音回答问题、做出选择,AI 则根据回答实时调整剧情和角色反馈。公司同时披露此前完成的1100 万欧元种子轮融资,投资方包括 General Catalyst 和 Balderton Capital。

  • 语音成为游戏的主要交互方式:孩子将角色玩偶放在音箱顶部,即可启动冒险故事、生物养成、迷你游戏或知识问答。过程中无需屏幕和手柄,孩子通过语音与角色交流、解谜和完成挑战,系统根据回答动态推进游戏。目前已与 Nathan 旗下科普系列 Kididoc、动画 IP《瓢虫雷迪》合作推出互动内容。

  • 人类负责故事创作,AI 负责受控互动:Mallow 的故事、角色和游戏规则由编剧与游戏设计师预先创作,生成式 AI 在设定好的叙事与规则范围内理解儿童语音、生成回应并调整游戏进程。产品不提供开放式聊天机器人或 AI 陪伴功能,并通过多层安全防护、确定性规则和持续测试限制不适当的互动内容。

Mallow 表示,产品在两年多开发期间邀请超过300 名儿童及其家庭参与测试,累计完成6000 多次测试会话、约 900 小时游戏时长。目前已在法国开放预订,音箱含一枚玩偶售价 119.99 欧元,不收取订阅费。

https://mallow.fr/

3、欧洲语音 AI 公司 Deepslate 完成 770 万欧元种子轮:自研 Speech-to-Speech 模型,440ms 响应并支持欧盟本地部署

德国柏林语音 AI 公司 Deepslate 完成770 万欧元种子轮融资,由 42CAP 领投,Alstin Capital、SIVentures 等参投。公司专注于欧洲语言的端到端 Speech-to-Speech(S2S)模型,直接处理输入音频并生成语音响应,减少传统 ASR → LLM → TTS 串联流程的延迟,同时将数据处理和存储限制在欧盟境内,并提供企业私有化部署方案。

  • 440ms 语音响应,支持 27 种语言:Deepslate 在 Artificial Analysis 评测中取得440ms 响应时间。模型采用语音编码器、推理核心和语音解码器三部分架构,推理核心基于经过语言专项训练的开放权重 LLM,可以独立替换底层语言模型,而无需重新训练整个系统。

  • 面向欧洲企业的数据主权部署:Deepslate 的模型和推理服务运行于欧盟数据中心,已获得 ISO 27001 认证,企业也可以选择部署在自己的基础设施中。平台提供 API、SDK 和 SIP 接入,已在保险、呼叫中心等场景投入生产使用,API 推广价格为每分钟 0.02 欧元。

本轮融资将用于扩大欧洲语言训练数据,重点覆盖德国人名、街道名称和方言,同时继续降低模型延迟、改善语音质量,并扩展欧洲数据中心的部署规模。

(@Deepslate)

4、个人 AI 智能体公司 Instinct 完成 10 亿美元 C 轮融资:估值达 100 亿美元,超 50% 交易来自旅行预订,可智能体直接语音致电商家

个人 AI 智能体公司 Instinct 宣布完成10 亿美元 C 轮融资,投资方包括 Sequoia Capital、Benchmark Capital 和 Coatue,公司估值达到100 亿美元,较一个月前的 25 亿美元增长 3 倍。Instinct 提供可通过文字和语音交互的个人智能体,能够自主完成旅行预订、购物、订票、取消订阅等任务,并可使用独立电话号码和云电脑执行操作。

  • 旅行预订占平台交易量的 50% 以上:创始人 Noah Shinn 透露,Instinct 平台的年化交易额正接近10 亿美元,其中超过一半来自旅行相关交易,主要涉及机票、酒店等预订。该数字为交易总额,并非公司收入,具体统计口径尚未披露。

  • 智能体开始代替用户拨打电话:Instinct 近期推出 Concierge 功能,允许智能体直接致电商家,完成无法在线办理的预约等任务。平台还新增 Trusted Person Network,使不同用户的智能体能够相互协调行程和计划。

Instinct 目前仍采用邀请制,团队仅有14 名成员。本轮资金将用于扩大产品覆盖范围,并继续开发个人智能体的自主执行能力。

(@Techcrunch)

03 有态度的观点

1、Sam Altman:社会应接受 AI 带来的部分负面事件

OpenAI CEO 萨姆·奥尔特曼近日接受 Politico 播客《Decoded》采访时表示,世界应接受 AI 带来的部分负面事件,以换取技术收益和用户自主权。

他说,OpenAI 与部分更严格的 AI 安全倡导者的分歧之一,是认为社会在探索系统韧性时「一些不好的事情将会发生」,监管应采取更轻的方式。

这段表态是在讨论 OpenAI 与 Anthropic 的 AI 安全路线差异时提出的。奥特曼认为,AI 带来的好处数量级上会超过坏处;纽约大学荣誉教授 Gary Marcus 则批评这套说法把社会风险转成了公司扩张的代价。两种立场都围绕一个问题展开:模型被更广泛开放后,哪些风险可以由社会承担,哪些需要在发布前被挡住。

奥特曼的重点是把监管边界放在系统韧性和用户选择上:如果风险可以被发现、解释并在使用中修复,他倾向于让产品先进入真实环境;如果风险会造成不可逆伤害,则应在发布前设置限制。

Marcus 的反驳则集中在责任归属,认为把「会发生一些坏事」当成创新成本,可能让受影响的人承担本应由公司和监管者承担的损失。

(@APPSO)

Voice Agent 学习笔记:了解最懂 AI 语音的头脑都在思考什么

写在最后:

我们欢迎更多的小伙伴参与「RTE 开发者日报」内容的共创,感兴趣的朋友请通过开发者社区或公众号留言联系,记得报暗号「共创」。

对于任何反馈(包括但不限于内容上、形式上)我们不胜感激、并有小惊喜回馈,例如你希望从日报中看到哪些内容;自己推荐的信源、项目、话题、活动等;或者列举几个你喜欢看、平时常看的内容渠道;内容排版或呈现形式上有哪些可以改进的地方等。

作者提示: 个人观点,仅供参考

版权声明: 本文来自互联网用户投稿,该文观点仅代表作者本人,不代表本站立场。本站仅提供信息存储空间服务,不拥有所有权,不承担相关法律责任。如若内容造成侵权/违法违规/事实不符,请联系邮箱:809451989@qq.com进行投诉反馈,一经查实,立即删除!
网站建设 2026/10/12 5:49:38

PS5游戏信息聚合平台实战:从数据采集到搜索排序

“AnyPS5”这名字,是我做这个个人项目时随手起的。它要解决的事情其实很具体:当你面对一台次世代主机,无论是刚入手还是已经玩了一年多,总会反复产生“这个游戏到底值不值得买”“现在入手是不是好价”“通关之后还有什么同类作品…

作者头像 李华
网站建设 2026/10/12 5:48:43

离散机加工行业中DNC是什么?

前言 在离散机加工行业信息化架构里,最底层是工段与数控机床;上层是技术、生产、计划、采购等业务部门。很多人都听过 DNC,但经常和 CNC、MDC 混淆。 CNC 是单台数控车床 / 加工中心的机床控制器;而 DNC,是打通办公室工…

作者头像 李华
网站建设 2026/10/12 5:47:20

掉地面包背后:烘焙食安全链条拆解与门店现场管理落地

一家开了五年的连锁面包店,因为一段“员工把掉在地上的面包捡起来放回货架”的视频,一夜之间登上热搜,总部电话被打爆,门店营业额当周腰斩。这类事这几年并不少见,每次出现都会让整个烘焙行业跟着紧张一次。你可能会觉…

作者头像 李华
网站建设 2026/10/12 5:46:47

Windows上Codex沙箱初始化失败?WSL2虚拟磁盘膨胀排查与修复

这周二(2026年10月8日)上午,我原本计划用Codex把那个长期搁置的模块重构收尾,结果刚跑到第二轮任务,工作流就卡死了。窗口里先是弹出沙箱初始化失败的报错,然后整个Codex会话直接中断,重试、重启…

作者头像 李华
网站建设 2026/10/12 5:46:26

bert-base-uncased文本分类微调实战:原理、参数与避坑指南

简介:面向需要在本地项目中加载BERT模型的自然语言处理开发者,这里提供的是bert-base-uncased预训练模型的完整离线包,专门解决运行中提示‘Can‘t load tokenizer for bert-base-uncased’的报错问题。压缩包共4个文件,包含词表文…

作者头像 李华