news 2026/10/10 13:40:21

AuK 被玩成了 ASMR 神器?语音模型刚开源,整活玩家已经把它做成本地音频工作台

作者头像

张小明

前端开发工程师

1.2k 24
文章封面图
AuK 被玩成了 ASMR 神器?语音模型刚开源,整活玩家已经把它做成本地音频工作台

AuK 被玩成了 ASMR 神器?语音模型刚开源,整活玩家已经把它做成本地音频工作台

【免费下载链接】AuK项目地址: https://ai.gitcode.com/tencent_hunyuan/AuK

2026 年 9 月 9 日,腾讯混元开源了 1.5B 参数的语音基础模型 AuK。按惯例,这类"语音生成与编辑大模型"的发布,社区第一波讨论应该集中在技术指标和基准测试上。但这次画风明显跑偏了——开源的第二天,CSDN 上就出现了题为"竟然能做 ASMR?"的实测文章,玩家们不再满足于让它念一段新闻稿,而是用自然语言指令把一段普通朗读"翻译"成耳语、把语速拖慢、把音量压低、把语气调成温柔放松,再叠加降噪与音源分离,拼出了一套跑在本地显卡上的 ASMR 素材流水线。

一个为语音生成与编辑设计的模型,为什么会被玩成"音频工作台"?这套玩法是怎么跑通的,又给开源模型冷启动带来了什么?本文结合 AuK 的官方源码仓库与社区实测情报,把这条"整活出圈"的技术链路拆开来看。

ASMR 玩法是怎么在 AuK 上跑通的

ASMR 内容的制作,本质上是围绕"声音质感"做精细控制:耳语、气音、呼吸声、慢速节奏、轻柔的音量,以及绝对干净的底噪。而 AuK 的任务设计恰好把这几项全占了。

看仓库 README 中官方列出的 Supported Tasks 表,AuK 把零样本 TTS、指令 TTS、内容编辑、歌词改写、音高/语速/音量编辑、情绪/音色/口音编辑、非语言声音编辑、耳语转换、语音增强、语音/音乐分离、目标说话人提取等任务,全部收敛到同一个"自然语言指令 + 参考音频"接口上。这正是 ASMR 整活能被"一句话"触发的前提:

  • 耳语转换(Whisper Conversion):直接在"正常说话 ↔ 耳语"之间切换,保留说话人和内容不变。ASMR 里最标志性的元素是耳语,而 AuK 把这种转换做成了模型的原生任务,不用任何后期插件。
  • 非语言声音编辑(Nonverbal Editing):可以移除或添加呼吸声、笑声、咳嗽。ASMR 玩家普遍依赖"气音 + 呼吸"营造近距离感,这个能力等于把音效素材库也塞进了模型。
  • 语速/音量/音高编辑:按倍数放慢语速、按分贝压低音量、按半音调整音高,输出时长随语速因子缩放。慢速、轻柔、低沉的"助眠声线"由此可以参数化批量生成。
  • 情绪与音色编辑:把语气切到温柔放松,或按一段描述更换音色;零样本 TTS 则可以用一段参考音频直接复刻某个声线,让"专属 ASMR 主播音色"成为可复用的资产。
  • 增强与分离:降噪、去混响、恢复清晰人声,或者从混合素材里单独提取人声/保留目标说话人——这是把杂乱的录音素材"洗"成干净底稿的关键步骤。

把这组能力串起来,一条 ASMR 生产流水线就成立了:先用分离和增强把素材洗干净,再用零样本 TTS 锁定声线,接着用耳语转换、语速音量控制和情绪编辑做"氛围加工",最后用非语言声音编辑补上呼吸与气音。整个过程不再依赖十几个独立插件,而是同一模型、同一接口下的连续指令操作。

这背后是 AuK 的架构设计在支撑。模型采用"多模态大语言模型编码语义 + VAE 编码声学 + 整流流扩散 Transformer 生成"的三段式结构:以 Qwen2.5-Omni-3B 作为指令编码器解析自然语言意图,以联合语音、通用音频与音乐训练的 BigVGANFlowVAE 负责声学编解码,生成主干则是"双流 MMDiT + 单流 DiT"的混合整流流 Transformer。仓库根目录的 config.yaml 给出了工程侧的关键数值:主干为 Flux2Edit + CFMEdit,10 层 MMDiT、20 层单流 DiT,隐层维度 1536,VAE 潜变量维度 64、下采样率 480、输出 24kHz 音频。技术报告披露,该模型基于约 30.3 亿条指令-音频实例、合计 195 万小时的有效监督数据训练,覆盖生成、内容编辑、增强分离、副语言编辑、声学编辑五大任务族,并在生成预热后进入"生成 + 编辑"联合预训练,再以人类反馈偏好优化(DPO)与基于奖励的强化学习做后训练。

换句话说,AuK 不是把 ASMR 当作一个"专项"去训练的,而是因为任务接口足够统一、能力覆盖足够宽,让"整活"变成了一件几乎零成本的事——玩家不需要读论文,只需要会写指令。

一键整合包把模型门槛压到多低

但"能力有"和"跑得起来"之间,还隔着一道部署门槛。AuK 不是单文件模型:推理时需要同时加载主模型权重、3B 的 Qwen2.5-Omni 指令编码器,以及 VAE 权重。仓库本身给出了完整的权重清单——根目录下的 auk_base.safetensors 与 vae.safetensors 即官方发布的基座与 VAE 权重,编码器则需按 README 中的指引从 Hugging Face 或 ModelScope 单独下载。这也是社区实测文章中反复强调的"显存要求较高"的根源:config.yaml 中记录的梯度检查点优化可将训练峰值显存从约 91G 压到约 75G,但推理端同样吃资源,玩家通常需要 24G 及以上显存的显卡才跑得舒服。

正因如此,"一键整合包"成了这波出圈玩法的实际推手。社区在开源次日就出现了打包了权重、推理脚本与 Web 界面的"本地音频工作台"整合包,把"下载三个组件、配环境、写命令"压缩成解压即用。从社区实测文章的反馈看,这类整合包把使用门槛压到了这样的程度:玩家要做的只是准备一段参考音频、一句指令,然后点几下按钮。当然,门槛降低不等于没有边界,实测中也暴露了 AuK 当前的明确限制——单次处理约 30 秒的音频长度上限,以及情绪编辑能力偏弱(技术报告拆读中情绪编辑成功率约 9.94%),这意味着 ASMR 长素材仍需切片处理,情绪渲染类操作也还不能完全依赖模型。

值得强调的是,AuK 官方同步发布了面向快速推理的蒸馏版本 AuK-Flash:通过一致性初始化与任务路由的 Decoupled DMD 蒸馏,实现 4 步推理且无需 classifier-free guidance,在同等条件下获得约 4.5 倍的墙钟加速。对本地玩家而言,这直接意味着长音频切片处理的等待时间被大幅压缩,"本地音频工作台"从理论可行变成了体验可用。此外,SGLang-Omni 在开源当天就完成了 Day 0 接入,一条python -m sglang_omni.cli serve --model-path tencent/AuK即可拉起服务;Gradio 与 ComfyUI 的部署路径也在社区教程中被反复验证。官方基准测试显示,AuK 在零样本与指令式语音生成、通用指令编辑任务上处于领先位置,同时保持了对信号级修复类任务(增强、分离)的竞争力。

从"需要读懂 config.yaml 里 91G→75G 的显存账"到"解压即用的音频工作台",整合包填补的是开源模型与普通用户之间最粗的那根管道。模型本身的 MIT 协议在这里起了决定性作用——权重、代码均允许再分发与商用,整合包分发没有法律障碍,社区的二次打包才敢放心往下传。

整活玩法出圈对开源模型冷启动的意义

AuK 这波"被玩成 ASMR 神器"的传播,提供了一个观察开源语音模型冷启动的极佳样本。技术类项目在开源初期面临的最大问题不是能力,而是注意力:论文、基准、架构图只能触达研究者,触达不到更广的创作者群体。而整活玩法天然自带传播势能——"一句话把语音变成耳语""复刻任意声线""本地跑一个音频工作台",每一个都是短视频和帖子级的选题,能把模型的能力翻译成普通用户能感知的结果。

这种出圈对冷启动的价值是结构性的。其一,它为模型积累了第一波真实的非学术使用场景。ASMR 玩家对音质、语气、气音的敏感度远高于评测基准,他们的实测反馈直接暴露了 30 秒长度限制、情绪编辑薄弱等评测表上看不出的短板,这些反馈会倒灌回模型迭代与工具生态。其二,它为生态接入提供了社区素材。SGLang-Omni 的 Day 0 支持、ComfyUI 节点、整合包的涌现,本质上都是"有人真的在用它干活"之后才跟进的工程投入。其三,MIT 许可 + 泛化任务设计构成了正循环的底座:任务越宽,整活空间越大;整活越多,社区教程与工具越丰富;工具越丰富,模型的使用门槛越低,反过来又吸引更多非专业用户入场。

当然,整活出圈也有需要警惕的一面。ASMR 玩法本质上依赖的是"音色复刻 + 内容改写"这类高自由度能力,它们在带来趣味的同时,也把声纹伪造、内容篡改等风险从实验室推向了普通用户。AuK 作为开源基座模型,代码与权重完全公开,能力边界管理更多要依赖部署方的使用规范与社区自律。这是所有开源生成模型都要面对的问题,AuK 只是把问题具象成了一个足够生动的案例。

从技术报告到 ASMR 工作台,AuK 用一周时间走完了很多开源项目需要数月才能完成的"触达普通用户"这一步。对开发者而言,这件事的启示或许更朴素:一个模型能否被社区用起来,往往不取决于它宣称覆盖了多少基准,而取决于它能否被一个具体的、生动的场景"接住"。当玩家们开始用自然语言指挥它做耳语、调气音、改声线的时候,这个 1.5B 的语音模型,才算真正意义上在社区里活了过来。

【免费下载链接】AuK项目地址: https://ai.gitcode.com/tencent_hunyuan/AuK

创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

版权声明: 本文来自互联网用户投稿,该文观点仅代表作者本人,不代表本站立场。本站仅提供信息存储空间服务,不拥有所有权,不承担相关法律责任。如若内容造成侵权/违法违规/事实不符,请联系邮箱:809451989@qq.com进行投诉反馈,一经查实,立即删除!
网站建设 2026/10/10 13:39:47

能做14981合金的优质公司有哪些 上海三青股份 按需定制交期快

德标耐热钢1.4981:中高温工况的稳健之选 在能源装备、汽轮机、锅炉部件与化工换热装置持续向高温高压升级的今天,耐热钢的市场需求正稳步扩张。 德标合金以德国材料编号为纲,凭借严苛的成分控制与稳定的服役表现,成为航空航天、能…

作者头像 李华
网站建设 2026/10/10 13:39:11

PCA9422+PIC24双芯片电源管理设计实战

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

作者头像 李华
网站建设 2026/10/10 13:38:10

Simulink单机无穷大系统两相接地短路暂态稳定仿真

1. 为什么单机无穷大系统是理解暂态稳定的最佳模型1.1 从“单机无穷大”的假设说起:物理意义与建模逻辑刚接触电力系统暂态稳定仿真的人,最容易被各种复杂模型吓住——多机系统、网络化简、动态等值,听着就头大。但几乎所有教材、几乎所有科研…

作者头像 李华
网站建设 2026/10/10 13:38:10

Terminal-Bench 4.0实测:Sonnet 5.5如何重塑DevOps终端智能体

先说说我最近在朋友圈和运维群里看到的动静:一串人对着 Terminal-Bench 4.0 的新榜单反复刷新,结果发现头部模型在真实终端实操上的分数掉头往上蹿了一截。要知道在这类面向开发者的基准测试里,之前大家的共识是“写代码还行,真进…

作者头像 李华
网站建设 2026/10/10 13:37:57

基于Matlab的多微网能源集线器协同优化建模与分布式求解

从单微网模型跑通,到把多个微网、多个energy hub以及电热气多种能源网络捏进同一个协同优化框架里,这中间的跨度远比想象中大。我做这个项目的初衷很直接:单微网的能量管理已经相对成熟,但实际园区、村镇级场景里,往往…

作者头像 李华
网站建设 2026/10/10 13:36:23

AI漫剧量产全链路实操:零基础也能跑通自动化流水线

1. 先搞清楚AI漫剧的量产链路长什么样说实话,我刷短视频的时候刷到过不少AI漫剧账号,刚开始觉得这就是把几张AI图拼一拼、配个音的事儿,直到自己下场报了个线上创作营,才意识到事情没那么简单。所谓“AI漫剧智能量产”&#xff0c…

作者头像 李华