news 2026/9/3 22:42:40

FastGPT 语音交互实战:4 步配好语音输入与语音播报

作者头像

张小明

前端开发工程师

1.2k 24
文章封面图
FastGPT 语音交互实战:4 步配好语音输入与语音播报

FastGPT 语音交互实战:4 步配好语音输入与语音播报

【免费下载链接】FastGPTFastGPT is a knowledge-based platform built on the LLMs, offers a comprehensive suite of out-of-the-box capabilities such as data processing, RAG retrieval, and visual AI workflow orchestration, letting you easily develop and deploy complex question-answering systems without the need for extensive setup or configuration.项目地址: https://gitcode.com/GitHub_Trending/fa/FastGPT

在手机上、在车间里、在开车途中,打字总是不方便。你只需要对着一句话说话,AI 就能听懂并回答;回答完了,还能直接用语音念给你听。FastGPT 的语音交互功能就是干这件事的:语音输入负责把录音转成文字问题,语音播报负责把 AI 的文字回复念出来。下面带你从零把它跑起来。

🎙️ 先搞懂它是怎么工作的

语音输入的路径很简单:浏览器把麦克风录到的音频交给一个语音识别(STT)模型,比如官方示例里用的 SenseVoiceSmall,模型返回识别出的文字,填入输入框。你可以让它"自动发送",录完直接问出去;也可以关掉,让用户先看看识别得准不准再发。

语音播报有两条路。一条是调用 TTS 语音模型,比如 fish-speech-1.5,服务端把音频流式返回,前端边收边播——回答还没生成完,前面的句子已经先读出来了;另一条是直接用浏览器内置的语音合成,零配置但音色比较普通。模型方式下,系统会按句号、问号等标点把长文拆成短句逐段合成,避免"憋着全文才开口"的尴尬。

上手教程:4 步配置语音功能

  1. 配置语音模型。到"设置 → 模型"里添加 TTS 和 STT 模型,并创建对应渠道。可以参照 硅基流动接入示例,里面演示了选 fish-speech-1.5 做语音模型、SenseVoiceSmall 做语音输入模型。完成后到模型测试页点一下,看到全部通过即可。

  1. 开启语音播报。进入要配语音的应用,在应用配置里找到"语音播报",选择刚才配好的 TTS 模型。做完后弹窗里能直接试听,听到朗读声说明通了。

  2. 开启语音输入。在应用配置里打开"语音输入",按需勾选"自动发送"和"自动语音回复"。保存后,前台对话的输入框里会多出一个麦克风图标,这就是验证点。

  1. 发布并实测。应用改完记得点发布,再到聊天页按住麦克风说一句话。看到文字自动出现在输入框、AI 回答后自动念出来,整条链路就跑通了。更多细节可以看 语音输入官方文档。

实际用起来是什么体验

移动端和现场场景。用户单手操作、戴着工牌手套,语音输入把"打字"这个门槛直接抹掉了。关掉自动发送,让对方确认一下识别文字再发出,能明显减少识别偏差带来的来回纠正。

连续语音对话的客服场景。把"自动发送"和"自动语音回复"同时打开,用户说一句、AI 答一句、答完直接念出来,全程不用碰屏幕,节奏接近真实对话。

给不方便看屏幕的用户。语音播报让视障或临时没法看屏幕的用户也能完整获得 AI 的回答内容,配合知识库问答,效果就是"问一句、听一段"。

常见问题

Q:提示"您的浏览器不支持语音输入"怎么办?先检查麦克风权限:浏览器要允许本站使用麦克风并选对设备;另外麦克风只在有 SSL 证书的站点(https)可用。排查步骤见 聊天框常见问题。

Q:开了自动语音回复,为什么 AI 没有念出来?自动语音回复依赖语音播报功能,两个必须同时开启。只开了语音输入而没配 TTS 模型,回答就只有文字。

Q:语音播报选模型还是选浏览器合成?想音色自然、可控就配 TTS 模型;只是内部简单用、不想额外申请模型额度,浏览器合成开箱即用,无需任何配置。

Q:配完语音功能,聊天里怎么没生效?应用配置修改后需要点"发布",前台聊天才会用上新配置。

到这里,你的应用已经具备了"能听、能答、能念"的完整语音能力。想继续深入,建议顺着 语音输入文档 和 模型配置说明 把 STT、TTS 模型换成更贴合自己业务的版本,再按场景调好自动发送的开关。

【免费下载链接】FastGPTFastGPT is a knowledge-based platform built on the LLMs, offers a comprehensive suite of out-of-the-box capabilities such as data processing, RAG retrieval, and visual AI workflow orchestration, letting you easily develop and deploy complex question-answering systems without the need for extensive setup or configuration.项目地址: https://gitcode.com/GitHub_Trending/fa/FastGPT

创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

版权声明: 本文来自互联网用户投稿,该文观点仅代表作者本人,不代表本站立场。本站仅提供信息存储空间服务,不拥有所有权,不承担相关法律责任。如若内容造成侵权/违法违规/事实不符,请联系邮箱:809451989@qq.com进行投诉反馈,一经查实,立即删除!
网站建设 2026/9/3 22:41:05

数学建模国赛A题全流程:从物理建模到Python实现

2025年数学建模国赛A题是很多参赛队伍最关心也最头疼的一道题。每年赛题公布后,总能看到这样的情况:队伍里有人擅长推导公式,有人Python写得不错,有人论文功底扎实,但三个人凑在一起,面对A题里长长的物理背…

作者头像 李华
网站建设 2026/9/3 22:40:33

战舰世界海门评测:B+背后的吉野Turbo与金刚ProMax

《战舰世界》中每艘船的评测结论,不能只盯着推荐度。以“海门”这张莱服评测卡为例,推荐度B只是结果,真正有价值的是“吉野Turbo”和“金刚ProMax”这两个外号背后的作战定位。如果只看B,很容易误判成一艘不值得练的船&#xff1b…

作者头像 李华
网站建设 2026/9/3 22:36:37

海康威视监控摄像头内网接入

引入插件&#xff1a;<script src"./jquery-1.7.1.min.js"></script><script id"videonode" src"./webVideoCtrl.js"></script><script src"./jsVideoPlugin-1.0.0.min.js"></script>代码实现&am…

作者头像 李华
网站建设 2026/9/3 22:35:21

Tucker分解与张量草图:高维数据压缩的工程实践

简介&#xff1a;本资源是一套面向图像处理与张量计算方向研究者及高年级本科生的Tucker分解实践工具包&#xff0c;聚焦于多维图像数据的降噪、增强与特征提取等预处理任务。压缩包共30个文件&#xff08;83KB&#xff09;&#xff0c;含14个MATLAB主程序&#xff08;如tucker…

作者头像 李华
网站建设 2026/9/3 22:32:50

WinForms数据可视化:ScottPlot从入门到性能优化实战

简介&#xff1a;面向.NET/C# WinForm开发者的ScottPlot演示资源包&#xff0c;基于贝塞尔曲线等图形场景&#xff0c;解决WinForm中大规模数据交互展示与绘图效率问题&#xff0c;适合需要快速集成折线图、柱状图、饼图、散点图的中级开发者。包体共34个文件&#xff0c;约1MB…

作者头像 李华