Ubuntu20.04上Fish-Speech-1.5开发环境搭建全指南
想快速体验Fish-Speech-1.5的语音合成效果?跟着本指南,30分钟完成环境搭建,立即开始生成高质量语音!
1. 环境准备:确保系统就绪
在开始安装之前,我们先来检查一下你的Ubuntu20.04系统是否满足基本要求。Fish-Speech-1.5作为一个先进的语音合成模型,对硬件还是有一定要求的。
1.1 系统要求检查
打开终端,运行以下命令查看你的系统配置:
# 查看系统信息 lsb_release -a # 查看GPU信息(如果有NVIDIA显卡) nvidia-smi # 查看内存大小 free -h最低配置要求:
- Ubuntu 20.04 LTS 或更高版本
- 至少16GB系统内存
- 如果有NVIDIA显卡:至少8GB显存(RTX 3070或更高)
- 50GB可用磁盘空间
推荐配置:
- Ubuntu 22.04 LTS
- 32GB系统内存
- NVIDIA RTX 4090(24GB显存)
- 100GB可用磁盘空间
如果你的系统满足这些要求,我们就可以继续下一步了。如果没有独立显卡,也可以用CPU运行,只是生成速度会慢一些。
1.2 更新系统包
首先更新你的系统包列表,确保所有软件都是最新版本:
# 更新包列表 sudo apt update # 升级已安装的包 sudo apt upgrade -y # 安装基础开发工具 sudo apt install -y build-essential curl wget git vim这个过程可能需要几分钟时间,取决于你的网络速度和系统更新情况。
2. 安装必要依赖:搭建基础环境
Fish-Speech-1.5依赖一些特定的库和工具,我们需要先安装这些基础组件。
2.1 安装Python和pip
Ubuntu 20.04默认带有Python 3.8,但我们需要确保pip也正确安装:
# 安装Python3和pip sudo apt install -y python3 python3-pip python3-venv # 验证安装 python3 --version pip3 --version建议使用Python 3.8或更高版本,Fish-Speech-1.5对这些版本都有很好的支持。
2.2 安装CUDA和cuDNN(GPU用户)
如果你有NVIDIA显卡,需要安装CUDA工具包。这里以CUDA 11.8为例:
# 添加NVIDIA包仓库 wget https://developer.download.nvidia.com/compute/cuda/repos/ubuntu2004/x86_64/cuda-ubuntu2004.pin sudo mv cuda-ubuntu2004.pin /etc/apt/preferences.d/cuda-repository-pin-600 sudo apt-key adv --fetch-keys https://developer.download.nvidia.com/compute/cuda/repos/ubuntu2004/x86_64/3bf863cc.pub sudo add-apt-repository "deb https://developer.download.nvidia.com/compute/cuda/repos/ubuntu2004/x86_64/ /" # 安装CUDA sudo apt update sudo apt install -y cuda-11-8 # 设置环境变量 echo 'export PATH=/usr/local/cuda/bin:$PATH' >> ~/.bashrc echo 'export LD_LIBRARY_PATH=/usr/local/cuda/lib64:$LD_LIBRARY_PATH' >> ~/.bashrc source ~/.bashrc安装完成后,运行nvidia-smi确认CUDA是否正确安装。
2.3 安装其他系统依赖
安装一些音频处理相关的系统库:
# 安装音频和视频处理库 sudo apt install -y ffmpeg libsndfile1 libportaudio2 portaudio19-dev # 安装开发工具 sudo apt install -y cmake pkg-config libopenblas-dev liblapack-dev这些库是语音处理的基础,确保它们正确安装可以避免后续出现各种奇怪的问题。
3. 创建Python虚拟环境
为了避免包冲突,我们为Fish-Speech-1.5创建一个独立的Python虚拟环境。
# 创建项目目录 mkdir -p ~/projects/fish-speech cd ~/projects/fish-speech # 创建虚拟环境 python3 -m venv fish-env # 激活虚拟环境 source fish-env/bin/activate激活虚拟环境后,你的命令行提示符前面会出现(fish-env)字样,表示你现在在这个环境中工作。
4. 安装Fish-Speech-1.5
现在开始安装Fish-Speech-1.5本身及其依赖。
4.1 安装PyTorch
首先安装适合你硬件配置的PyTorch版本:
# 对于CUDA 11.8用户 pip install torch torchvision torchaudio --index-url https://download.pytorch.org/whl/cu118 # 对于CPU用户 pip install torch torchvision torchaudio安装完成后,可以验证PyTorch是否能正确识别你的硬件:
import torch print(f"PyTorch版本: {torch.__version__}") print(f"CUDA可用: {torch.cuda.is_available()}") if torch.cuda.is_available(): print(f"GPU型号: {torch.cuda.get_device_name(0)}")4.2 安装Fish-Speech-1.5
现在安装Fish-Speech-1.5包:
# 安装核心包 pip install fish-speech # 安装额外依赖 pip install gradio transformers datasets这个过程可能会花费一些时间,因为需要下载和编译一些组件。如果网络不稳定,可以考虑使用国内镜像源。
5. 下载预训练模型
Fish-Speech-1.5需要下载预训练模型权重才能工作。模型文件比较大(约几个GB),所以需要稳定的网络连接。
# 创建模型存储目录 mkdir -p ~/models/fish-speech cd ~/models/fish-speech # 使用huggingface-hub下载模型 pip install huggingface-hub huggingface-cli download fishaudio/fish-speech-1.5 --local-dir .如果下载速度较慢,你可以考虑手动下载模型文件,然后放到对应的目录中。
6. 配置开发环境
为了让开发过程更加顺畅,我们配置一些常用的开发工具。
6.1 安装Jupyter Notebook
# 安装Jupyter pip install jupyterlab ipython # 创建配置文件 jupyter notebook --generate-config # 设置密码 jupyter notebook password6.2 配置代码编辑器
如果你使用VS Code,可以安装一些有用的扩展:
# Python扩展 code --install-extension ms-python.python # Jupyter扩展 code --install-extension ms-toolsai.jupyter7. 测试安装结果
现在让我们测试一下Fish-Speech-1.5是否安装成功。
7.1 基本功能测试
创建一个简单的测试脚本:
# test_fish_speech.py import torch from fish_speech import TextToSpeech # 检查环境 print("环境检查:") print(f"PyTorch版本: {torch.__version__}") print(f"CUDA可用: {torch.cuda.is_available()}") # 尝试加载模型 try: tts = TextToSpeech.from_pretrained("fishaudio/fish-speech-1.5") print("✓ 模型加载成功") except Exception as e: print(f"✗ 模型加载失败: {e}")运行测试脚本:
python test_fish_speech.py如果一切正常,你应该看到成功的提示信息。
7.2 生成第一个语音
让我们尝试生成一段简单的语音:
# first_speech.py from fish_speech import TextToSpeech import soundfile as sf # 初始化TTS tts = TextToSpeech.from_pretrained("fishaudio/fish-speech-1.5") # 生成语音 text = "你好,欢迎使用Fish Speech语音合成系统" audio = tts(text) # 保存音频 sf.write("output.wav", audio.numpy(), 22050) print("语音生成完成,保存为output.wav")运行这个脚本,等待几分钟(第一次运行需要加载模型),你就会在当前目录下看到生成的output.wav文件。
8. 常见问题解决
在安装过程中可能会遇到一些问题,这里列出一些常见的解决方法。
8.1 CUDA相关错误
如果遇到CU错误,首先检查CUDA版本是否匹配:
# 检查CUDA版本 nvcc --version # 检查PyTorch的CUDA版本 python -c "import torch; print(torch.version.cuda)"两个版本应该一致,如果不一致,需要重新安装对应版本的PyTorch。
8.2 内存不足问题
如果遇到内存不足的错误,可以尝试以下方法:
# 减少批量大小 export BATCH_SIZE=1 # 使用CPU模式(速度会慢很多) export CUDA_VISIBLE_DEVICES=""8.3 模型下载问题
如果模型下载失败,可以手动下载:
# 手动下载链接(请检查最新版本) wget https://huggingface.co/fishaudio/fish-speech-1.5/resolve/main/model.safetensors wget https://huggingface.co/fishaudio/fish-speech-1.5/resolve/main/config.json9. 下一步学习建议
现在你已经成功搭建了Fish-Speech-1.5的开发环境,接下来可以:
- 阅读官方文档:了解所有可用的功能和参数配置
- 尝试不同语言:Fish-Speech支持多种语言,试试生成英文、日文等其他语言的语音
- 调整语音风格:实验不同的语音参数,生成不同风格和情感的语音
- 集成到项目:将TTS功能集成到你自己的应用程序中
记得经常查看项目的GitHub页面,获取最新的更新和改进。Fish-Speech还在快速发展中,新功能会不断加入。
环境搭建其实没有想象中那么难,关键是按步骤来,遇到问题耐心解决。我在第一次安装时也踩过不少坑,但一旦跑通之后,听到自己生成的第一个语音时,那种成就感还是很棒的。建议你先从简单的文本开始试起,熟悉了基本操作后再尝试更复杂的功能。
获取更多AI镜像
想探索更多AI镜像和应用场景?访问 CSDN星图镜像广场,提供丰富的预置镜像,覆盖大模型推理、图像生成、视频生成、模型微调等多个领域,支持一键部署。