news 2026/9/13 17:41:42

FunASR Hugging Face 预训练模型仓库(Model Zoo)完整指南:许可证边界、模型清单与接入方式

作者头像

张小明

前端开发工程师

1.2k 24
文章封面图
FunASR Hugging Face 预训练模型仓库(Model Zoo)完整指南:许可证边界、模型清单与接入方式

FunASR Hugging Face 预训练模型仓库(Model Zoo)完整指南:许可证边界、模型清单与接入方式

【免费下载链接】FunASROpen-source speech recognition toolkit for training, inference, streaming ASR, VAD, punctuation, speaker diarization pipelines, and OpenAI-compatible/MCP serving.项目地址: https://gitcode.com/GitHub_Trending/fun/FunASR

FunASR 是一个开源的语音识别工具包,其 Hugging Face 模型仓库(Model Zoo)集中收录了语音识别(ASR)、语音活动检测(VAD)、标点恢复、说话人相关任务以及第三方统一转写/说话人日志(Diarization)等方向的预训练模型与对应接口约定。本文以 model_zoo/huggingface_models.md 为核心,结合仓库源码逐项说明许可证边界、模型清单(含参数规模、语言覆盖、离线/在线属性)、别名解析机制与原生 Transformers 接入方式,帮助你按任务快速选型并在服务化部署前厘清各 checkpoints 的差异。

一、许可证边界:软件许可证 ≠ 模型权重许可证

FunASR 工具包本体采用 MIT 软件许可证,但模型权重遵循单独的条款。使用或再分发任何 checkpoint 前,必须逐一核对对应模型卡(model card)、随附许可证文件(license file)以及所选 revision:

  • FunASR 模型开源协议(版本 1.1)仅适用于其发布条款明确采纳该协议的模型,并非本目录中所有条目的默认许可;
  • 第三方模型(例如 OpenMOSS 发布的 MOSS-Transcribe-Diarize)保留其原始作者身份与模型专属许可证(Apache-2.0),FunASR 团队不代为声明其许可条款;
  • 再分发模型或派生制品时需保留上游署名。

选型与部署边界方面,官方建议先阅读 Model Zoo 总览 与 MOSS 集成指南。模型 Zoo 总览中还有一句重要提醒:一个模型被列入清单,不代表它被每一个服务端或导出后端自动支持——模型、checkpoint 格式、运行时要分开选择。

二、模型清单总览(Hugging Face 收录条目)

以下清单对应 model_zoo/huggingface_models.md 中实际收录的 HF 条目。清单还包含部分历史变体,正式使用前务必核对每个模型卡。

2.1 Fun-ASR-Nano 系列:按接口选择 checkpoint

Fun-ASR-Nano 是 FunASR 的旗舰模型(SenseVoice 编码器 + Qwen3 解码器的 LLM 路径),覆盖中文、英文、日文及中文方言/口音。关键在于:同一模型名存在多个互不通用(not interchangeable)的 checkpoint 产物,需按加载接口区分:

Checkpoint接口适用范围
Fun-ASR-Nano-2512-hf原生 Transformers5.17.0AutoProcessor+AutoModelForSpeechSeq2Seq中/英/日转写;不依赖远程 Python 代码;不提供词级时间戳或说话人身份
Fun-ASR-Nano-2512FunASR 工具包AutoModel原始工具包产物;与原生导出不可互换
Fun-ASR-Nano-2512-vllm原生 vLLM独立的服务化转换与运行时产物
Fun-ASR-MLT-Nano-2512FunASR 工具包独立的 31 语言 checkpoint,并非 zh/en/ja 原生导出的语言覆盖

注意:MLT(多语言)checkpoint 是独立模型,不能把其 31 语言覆盖能力归因到基础 Nano 模型上。基础 checkpoint 与 vLLM 转换后的 checkpoint 也是不同的 artifact。

Fun-ASR-Nano 的入门路径有三条:原生 Transformers 指南、在线 Space 演示、以及批量示例与 Notebook;若需要服务化,则按 部署矩阵 选择路径。

2.2 Paraformer 模型

Paraformer 是非自回归(NAT)离线 ASR 模型,中文语音识别的主流选择,支持字符级时间戳与热词:

模型名语言训练数据词表大小参数量离线/在线备注
Paraformer-large中英Alibaba Speech Data(60000 小时)8404220M离线输入 wav 时长 ≤ 20s

该模型的原始工具包版本以paraformer-zh别名在 HF 与 funasr/models/seaco_paraformer(paraformer-zh别名在 ModelScope 端实际解析到 SeACo checkpoint)。

2.3 语音活动检测(VAD)

模型名训练数据参数量采样率备注
FSMN-VADAlibaba Speech Data(5000 小时)0.4M16000检测语音起止,不转写、不识别说话人

FSMN-VAD 通过fsmn-vad别名接入,源码实现位于 funasr/models/fsmn_vad_streaming,可配合 ASR 组成"VAD → 识别"流水线。

2.4 标点恢复(Punctuation Restoration)

模型名训练数据参数量词表大小离线/在线备注
CT-TransformerAlibaba Text Data70M272727离线离线标点恢复模型

CT-Transformer 通过ct-punc别名接入,实现见 funasr/models/ct_transformer(离线版)与 funasr/models/ct_transformer_streaming(在线版)。需要注意:标点模型不生成声学时间戳

2.5 第三方统一转写与说话人日志(Third-party)

模型名发布方参数量备注
MOSS-Transcribe-DiarizeOpenMOSS见官方模型卡第三方 Apache-2.0 模型。一次离线请求同时返回转写文本、时间戳与说话人标签;FunASR 集成路径无需外部 VAD 服务。

MOSS 与 FunASR 生态的对接细节(backend="hf"/"vllm"/"sglang"三种后端、sentence_info返回契约、部署容器等)见 MOSS 部署指南。从源码结构看,其适配器在 funasr/models/moss_transcribe_diarize 中实现,保留上游 tagged 生成于raw_text,并把解析出的start/end/spk/text归一化为统一的sentence_info字段。

2.6 未列入 HF 目录的历史模型家族

原目录中还存在 UniASR(流式离线统一模型)、Conformer、RNN-T、多说话人识别 MFCCA、语言模型、说话人验证(Xvector)、说话人日志(SOND)、时间戳预测(TP-Aligner)等家族的表格,但它们在 HF 清单中均以注释形式保留(仅提供 ModelScope 链接)。按照 Model Zoo 总览 的说明,这些属于"历史变体清单",完整 ModelScope 清单可查 modelscope_models.md。在新的服务中使用某个 checkpoint 之前,务必逐一核对模型卡。

三、如何在 FunASR 中接入 Hugging Face 模型:hub 映射与下载流程

清单中的 HF 模型可通过 FunASR 工具包直接加载。核心机制是别名映射表 funasr/download/name_maps_from_hub.py:SDK 别名(如paraformer-zhparaformer-enfsmn-vadct-puncfa-zhcam++)被解析为具体的 HF 仓库 ID:

name_maps_hf = { "paraformer": "funasr/paraformer-zh", "paraformer-zh": "funasr/paraformer-zh", "paraformer-en": "funasr/paraformer-en", "paraformer-zh-streaming": "funasr/paraformer-zh-streaming", "fsmn-vad": "funasr/fsmn-vad", "ct-punc": "funasr/ct-punc", "fa-zh": "funasr/fa-zh", "cam++": "funasr/campplus", ... }

别名解析与下载在 funasr/download/download_model_from_hub.py 中完成:download_model(**kwargs)根据hub参数("ms"/"modelscope"走 ModelScope,"hf"/"huggingface"huggingface_hub.snapshot_download"openai"走 Whisper 兼容路径)分发,随后读取本地configuration.jsonconfig.yamltokens.txtam.mvnbpe.model等文件,组装完整的模型初始化参数。别名只是便捷写法,并非不可变的模型 revision——生产环境建议记录解析后的具体 checkpoint/revision。

典型用法(显式指定 hub):

from funasr import AutoModel model = AutoModel(model="paraformer-zh", hub="hf", device="cpu") result = model.generate(input="meeting.wav") print(result[0]["text"])

替换meeting.wav为真实录音即可运行。注意:下载耗时、预热(warmup)与推理耗时是三个独立的测量项;验证时间戳、说话人标签或模型专属标签时,应保留原始返回结果。

仓库还提供了别名契约的测试用例:tests/test_hf_model_aliases.py 断言name_maps_hf["paraformer-en"] == "funasr/paraformer-en",保证英文别名指向英文 checkpoint。

四、原生 Transformers 路径:Fun-ASR-Nano-2512-hf

如果你不引入 FunASR 工具包,而希望直接用 Hugging Face 生态的标准接口,应选择Fun-ASR-Nano-2512-hf这个原生导出。官方 原生 Transformers 指南 提供了完整说明,核心要点如下:

  • Transformers 5.17.0 是已发布的正式包,原生支持 Fun-ASR-Nano,无需源码检出、无需 FunASR 工具包、无需模型自带的远程 Python 代码;
  • 需要匹配的torch/torchaudio(原生特征提取器使用torchaudio.compliance.kaldi.fbank);
  • 该 zh/en/ja 导出只返回文本,不含词级时间戳与说话人身份(原生导出省略了 CTC 时间戳分支);
  • 原生类位于transformers.models.fun_asr_nano

最小推理示例(CPU、float32):

import torch from transformers import AutoModelForSpeechSeq2Seq, AutoProcessor torch.set_num_threads(4) model_id = "FunAudioLLM/Fun-ASR-Nano-2512-hf" revision = "d93b302ee7fd505e1b3576120fc142fc6f7820e1" processor = AutoProcessor.from_pretrained(model_id, revision=revision, trust_remote_code=False) model = AutoModelForSpeechSeq2Seq.from_pretrained( model_id, revision=revision, trust_remote_code=False, dtype=torch.float32, ).to("cpu").eval() inputs = processor.apply_transcription_request( audio="your.wav", language="zh", processor_kwargs={ "return_tensors": "pt", "audio_kwargs": {"sampling_rate": 16000}, "text_kwargs": {"padding": True}, }, ) with torch.inference_mode(): generated = model.generate(**inputs, max_new_tokens=128, do_sample=False) new_tokens = generated[:, inputs.input_ids.shape[1]:] # 去除 prompt 部分 print(processor.batch_decode(new_tokens, skip_special_tokens=True)[0])

要点:

  • apply_transcription_request接受波形(必须标注真实采样率,不能把 48 kHz 样本标成 16 kHz)、本地路径或受支持的 URL;language"zh"/"en"/"ja"
  • 批量场景传入音频列表 + 等长语言列表 +text_kwargs={"padding": True},解码时保持输入顺序;
  • keywords(词汇提示)与prompt(上下文)不是强制词表,也不是工具包的hotword参数——例如中文样例中加开放时间并未纠正开饭时间的输出,需用代表性录音与人审评估质量;
  • max_new_tokens=128只是示例上限,缺失 EOS 可能意味着截断,增加上限并不证明长录音被完整覆盖;
  • 官方还提供了不加载权重的预处理自检脚本(合成静音经 processor 检查输出张量形状),但预处理成功不代表识别准确率或容量达标

五、选型、部署边界与可复现性

5.1 四个 checkpoint 不是同一个模型 ID

从 部署矩阵 与 原生 Transformers 指南 中的对照表可以归纳出四条相互独立的路径:

需求checkpoint 与接口
Python 内原生 TransformersFun-ASR-Nano-2512-hf+AutoProcessor+AutoModelForSpeechSeq2Seq
FunASR 流水线与 HTTP 适配Fun-ASR-Nano-2512+funasr.AutoModel(部署矩阵)
原生 vLLMFun-ASR-Nano-2512-vllm(原生 vLLM 验证)
C++ / 边缘设备转换后的 GGUF 文件(llama.cpp 运行时)

原生 Transformers 支持不附带HTTP 服务、队列、流式协议、词级时间戳或说话人身份。选择模型时,模型、checkpoint 格式、接口与运行环境要一起决定,再在目标硬件上验证 GPU dtype、注意力后端、显存、并发与质量。

5.2 公开资料与可复现性

  • 原生 public revision 为d93b302ee7fd505e1b3576120fc142fc6f7820e1,解析为FunAsrNanoForConditionalGenerationtrust_remote_code=False);model.safetensors大小 1,659,773,320 字节;
  • 官方验证记录(2026-09-09)基于实际发布的 5.17.0 wheel、Python 3.12.3、匹配的 torch/torchaudio 2.10.0+cpu、float32 与 4 线程,样本均返回非空文本且在 128 token 内到达 EOS;这些短样本不构成CER/WER、GPU 兼容性或服务容量的结论;
  • 若加载失败,先检查解释器、transformers.__version__(5.16.1 及更早版本不含该模型)、-hf模型 ID 与 revision。

六、总结与下一步

FunASR 的 Hugging Face Model Zoo 是一份"按任务 → 按接口"组织的预训练模型清单:从 LLM 路径的 Fun-ASR-Nano 系列、非自回归的 Paraformer-large,到轻量的 FSMN-VAD、CT-Transformer 与第三方 MOSS-Transcribe-Diarize。使用前牢记三点:许可证按权重单独核对、checkpoint 按接口区分、别名不等于固定 revision。进一步深入可参考:

  • 任务选型:模型选择指南;
  • SDK 参数与返回值契约:Python API 指南;
  • 说话人与情感标签:speaker_emotion.md、关键词唤醒:keyword_spotting.md;
  • 训练/微调:training.md、自定义模型注册:model_registration.md;
  • 质量与耗时分开度量:RTF 可复现性。

【免费下载链接】FunASROpen-source speech recognition toolkit for training, inference, streaming ASR, VAD, punctuation, speaker diarization pipelines, and OpenAI-compatible/MCP serving.项目地址: https://gitcode.com/GitHub_Trending/fun/FunASR

创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

版权声明: 本文来自互联网用户投稿,该文观点仅代表作者本人,不代表本站立场。本站仅提供信息存储空间服务,不拥有所有权,不承担相关法律责任。如若内容造成侵权/违法违规/事实不符,请联系邮箱:809451989@qq.com进行投诉反馈,一经查实,立即删除!
网站建设 2026/9/13 17:39:54

锂离子电池功率分配仿真:用ECEFUZY策略解决UDDS工况SOC漂移

简介:针对锂电池与超级电容混合储能系统,利用模糊逻辑实现功率分配的一份MATLAB/Simulink仿真项目资源,适合新能源汽车、电力电子及储能控制方向的学生和研究者参考。内容围绕ECE与UDDS两种典型工况,给出磷酸铁锂电池与超级电容的…

作者头像 李华
网站建设 2026/9/13 17:39:00

kohya_ss 实战手册:从 10 张图到可出图的 LoRA 微调完整流程

kohya_ss 实战手册:从 10 张图到可出图的 LoRA 微调完整流程 【免费下载链接】kohya_ss 项目地址: https://gitcode.com/GitHub_Trending/ko/kohya_ss 想在两天内把自己的 10 张图变成一版可用的 LoRA 训练权重,kohya_ss 是最短的路径。它把 Sta…

作者头像 李华
网站建设 2026/9/13 17:38:02

鸿蒙人脸识别门禁对接业务系统:API与MQTT工程规范实战

鸿蒙人脸识别门禁这东西,单机跑起来不难,真正让人头疼的是怎么跟业务系统打通。前阵子我正好在做一个园区项目,设备端基于鸿蒙系统做人脸识别门禁,后端要对接一套现成的综合管理平台。刚开始我天真地以为不就是调几个接口嘛&#…

作者头像 李华
网站建设 2026/9/13 17:35:46

2026年程序员接单平台选择与优化指南

1. 程序员接单平台概述程序员接单平台已经成为技术从业者获取项目机会、拓展职业发展的重要渠道。随着远程工作和自由职业的兴起,这类平台在2026年呈现出更加多元化和专业化的发展趋势。无论是刚入行的新手,还是经验丰富的技术专家,都能在这些…

作者头像 李华
网站建设 2026/9/13 17:35:36

ISO转CHD快速指南:游戏库省空间完整方案

ISO转CHD快速指南:游戏库省空间完整方案 【免费下载链接】romm A beautiful, powerful, self-hosted ROM manager and player. 项目地址: https://gitcode.com/GitHub_Trending/rom/romm 周末把散落各处的游戏搬进 romm(一个自托管的 ROM 管理器兼…

作者头像 李华