前两天刷 GitHub,撞见一个项目,盯着看了半天。
不是因为它多厉害,恰恰相反,它小得有点离谱。一个能克隆你声音、还能实时说 20 种语言的语音模型,整个才 1 亿参数。
你没看错,是 1 亿,不是 100 亿、1000 亿。
更离谱的是它不用显卡。普通四核 CPU,就能流式生成语音,边说边出声,不卡。
我第一反应是:这不科学。
咱们被这两年的大模型教育得,潜意识里都觉得"好模型等于大参数等于烧钱显卡"。想本地跑个语音克隆?那得 4090 起步吧,至少也得张卡。
结果这玩意儿直接把这套逻辑掀了。
它叫 MOSS-TTS-Nano,是 OpenMOSS 开源的。名字里带个 Nano,真不是谦虚。
用法也特别直白,直白到有点不真实。
你给它一段参考音频,比如你读一段话的录音,三五秒都行,再输入你想让它说的文字,它就能用那个音色把字念出来。音色细节保留得还挺像,不是那种塑料感十足的电子念稿,是能听出"这是那个人在说话"的程度。
最戳我的是它对长文本的处理。
平时用这类工具,最烦的就是:你扔给它一篇小说或者长文章,它要么一次性全生成卡半天,要么你得自己手动切段,麻烦得不想用第二次。MOSS-TTS-Nano 会自己分段,你管它叫"把这本小说读给我听",它就自动切、自动连,你不用管中间怎么断句怎么拼接。
这一点,比参数大小更让我觉得这东西真能用。
能拿来干嘛?其实挺多的。
做视频的,拿它配音,把自己亲人的语音丢给它轻松实现克隆不求人,自己不用再对着麦克风录十遍;想听书的,本地跑一个,小说直接变有声书,不花一分钱也不掉隐私;想折腾语音助手的,直接集成进去,轻得像片叶子。
关键是"本地"这两个字。数据不出你电脑,不调云 API,不按字数收费。对小团队、对个人、对那种"我就想安静做个东西"的人,这个组合太舒服了。
我越来越觉得,这两年大模型卷的方向有点歪。
大家都在比谁参数多、谁跑分高,好像参数少了就不好意思开口。可真正的问题是:这些东西,普通人用得上吗?在自己那台旧笔记本上跑得动吗?
MOSS-TTS-Nano 这种项目,就是一记耳光,不响,但清清楚楚。
它证明了一件事:小模型不是大模型的残次版,它走的是另一条路,把能力压进普通人够得着的硬件里,让"能用"本身变成一种竞争力。
顺手说下怎么上手:
去 GitHub 搜 OpenMOSS/MOSS-TTS-Nano
赶快点击前往
按 README 装一下就能跑,官方仓库里参数和效果都以那边的为准,我就不替它吹死了。
真心建议大家,这种小而能打的开源项目,平时多捡几个藏好。不一定马上用,但哪天你真需要了,回家直接抄作业,比临时抱佛脚香多了。
你电脑上跑过什么"意想不到能本地跑"的小模型?评论区聊聊。