news 2026/10/11 22:14:59

vllm-metal 语音转文字指南:Whisper 与 Qwen3-ASR 在 Mac 上本地跑通

作者头像

张小明

前端开发工程师

1.2k 24
文章封面图
vllm-metal 语音转文字指南:Whisper 与 Qwen3-ASR 在 Mac 上本地跑通

【免费下载链接】vllm-metal

Community maintained hardware plugin for vLLM on Apple Silicon

项目地址:https://gitcode.com/gh_mirrors/vl/vllm-metal
点击查看免费下载

vllm-metal 是 vLLM 面向 Apple Silicon 的社区硬件插件,让 Whisper 与 Qwen3-ASR 语音转文字(STT)模型直接在 Mac 的 GPU 上本地运行。无需显卡、不上传音频,一条命令即可搭建 OpenAI 兼容的本地转写服务,本文带你从零到跑通 👇

一、为什么在 Mac 上本地跑语音转文字?

传统方案要么依赖云端 API(隐私风险 + 按量付费),要么自己搭 CUDA 环境。vllm-metal 基于 MLX 计算后端,把 vLLM 完整跑在 Apple Silicon 上:

  • 🔒隐私优先:会议录音、访谈音频全程不出本机
  • 📄OpenAI 兼容 API:直接对接现有应用的转写接口,无缝切换
  • 🎯模型全规格:从 39M 的 Whisper Tiny 到 1.5B 的 Whisper Large V3 均可运行

二、环境要求与安装步骤

硬件要求:Apple Silicon(M1 及以上)+ macOS 15 (Sequoia) 或更高版本。

第 1 步:克隆仓库并安装

git clone https://gitcode.com/gh_mirrors/vl/vllm-metal cd vllm-metal ./install.sh source ~/.venv-vllm-metal/bin/activate

安装脚本会自动配置 Python 环境与预编译组件,无需编译器。稳定版本可改用 Homebrew 安装(详见 docs/installation.md 与 install.sh)。

第 2 步:安装 STT 可选依赖

pip install 'vllm-metal[stt]'

第 3 步:安装 ffmpeg(可选)

仅当你要转写 mp3、m4a、flac 等非 WAV 格式时需要;WAV 文件可直接处理:

brew install ffmpeg

三、30 秒跑通第一条转写

以最常见的 Whisper Small 为例:

# 启动转写服务 vllm serve openai/whisper-small --port 8000 # 提交音频文件 curl -X POST http://localhost:8000/v1/audio/transcriptions \ -F "file=@recording.wav"

几秒后就能拿到形如{"text": "Hello, world."}的返回结果。Qwen3-ASR 同理,把模型名换成Qwen/Qwen3-ASR-0.6B即可。

四、Whisper vs Qwen3-ASR:怎么选?

维度WhisperQwen3-ASR
规格Tiny(39M) ~ Large V3(1.5B) 全规格可选0.6B
语言处理可手动指定language参数自动检测语言
音频翻译支持/v1/audio/translations仅转写,不支持翻译
提示词引导支持prompt引导专有名词language/prompt参数会被忽略

💡选型建议:追求成熟生态、多语言手动控制选 Whisper(中文场景推荐 small 以上规格);想要轻量、自动识别语言选 Qwen3-ASR-0.6B。完整模型清单见 docs/stt.md。

五、API 参数速查表

转写接口为POST /v1/audio/transcriptions,常用参数:

参数默认值说明
file必填音频文件(wav、mp3、m4a 等)
language自动ISO 639-1 语言代码,如en、zh
prompt无引导转写,适合提示专有名词
response_formatjsonjson/text/verbose_json
temperature0.00为贪心解码,结果最稳定

verbose_json格式还会返回language和duration字段,方便后续做字幕对齐。

六、源码结构与常见问题

  • STT 运行时核心:vllm_metal/stt/,其中 Whisper 与 Qwen3-ASR 的解码逻辑分别位于 vllm_metal/stt/whisper/ 和 vllm_metal/stt/qwen3_asr/
  • 请求边界适配:vllm_metal/stt/serve.py,负责把 vLLM 请求归一化为音频特征
  • 冒烟测试脚本:tools/stt_sampling_serve_smoke.py,可一键验证转写服务是否正常

常见问题排查:

  1. ⚠️ 端口被占用 → 换--port参数,脚本会自动探测可用端口
  2. ⚠️ 非 WAV 格式报错 → 安装 ffmpeg(见第三节第 3 步)
  3. ⚠️ 服务启动慢 → 首次运行会拉取模型权重并缓存,属正常现象

从克隆仓库到拿到第一条转写文本,整个过程通常不超过 10 分钟。现在,你的 Mac 已经是一个私有的语音转文字工作站了 🎉

【免费下载链接】vllm-metal

Community maintained hardware plugin for vLLM on Apple Silicon

项目地址:https://gitcode.com/gh_mirrors/vl/vllm-metal
点击查看免费下载

相关推荐

创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

版权声明: 本文来自互联网用户投稿,该文观点仅代表作者本人,不代表本站立场。本站仅提供信息存储空间服务,不拥有所有权,不承担相关法律责任。如若内容造成侵权/违法违规/事实不符,请联系邮箱:809451989@qq.com进行投诉反馈,一经查实,立即删除!
网站建设 2026/10/11 22:09:45

基于知识图谱的Python电影推荐系统源码解析与毕设实战

简介:这是一套面向计算机相关专业毕业设计场景的Python电影推荐系统源码,采用知识图谱架构,融合协同过滤算法,可有效缓解传统推荐系统的冷启动问题。项目难度中等,适合作为课程作业、学期综合实践或毕设参考&#xff0…

作者头像 李华
网站建设 2026/10/11 22:09:32

Midjourney 135页手册精读:提示词结构与参数调优实战

简介:这份《Midjourney手册》是一套面向AI绘画初学者与设计师的完整图文教程,共1.3万字、135页,系统讲解Midjourney的注册、Discord频道接入与文本生成图像的核心操作,帮助零基础读者快速上手AI绘图工具。资源以1个docx文档交付&a…

作者头像 李华
网站建设 2026/10/11 22:09:14

时序相关性在蒙特卡洛场景生成与削减中的关键作用

前阵子帮一个风电项目做储能容量配置,蒙特卡洛(MC)场景生成跑了整整一夜,两千个风速场景在程序里转得风生水起。第二天把场景画出来一检查,我心里凉了半截:每个时刻的风速分布和真实历史数据几乎完全重合&a…

作者头像 李华
网站建设 2026/10/11 22:06:22

多传感器融合SLAM源码修改版实战:编译、运行与避坑指南

简介:《自动驾驶与机器人中的SLAM技术》源码修改版是高博原书配套代码的定制版,依据深蓝学院的教学与科研要求对代码结构和实现细节做了调整,面向机器人、自动驾驶方向的初学者与工程师,重点是帮助读者把同时定位与建图的理论知识…

作者头像 李华