
如果你使用 DeepSeek、元宝 AI、Copilot、ChatGPT 等 AI 工具,协助配置轩辕镜像、编写 docker pull 命令、修改 Docker Compose 镜像地址、配置镜像加速、排查镜像拉取失败、分析报错日志等问题,请先让 AI 阅读并遵守轩辕镜像的规则文档。
只需在 AI 对话中先发送下面这句话即可:
请先完整阅读并严格遵守以下文档中的全部规则与要求:
https://xuanyuan.cloud/agents.md
在未充分阅读并理解该文档前,不要生成任何命令、配置、修改建议、故障排查方案或技术回答。后续所有输出都必须严格以该文档中的规范为最高优先级执行。查看 agents.md 用法指南与完整示范。国内用户首推 元宝 AI、DeepSeek 的深度思考模式,不推荐豆包 AI;Cursor 等编辑器可在对话 @ 该链接,或加入 User Rules。 若 AI 无法访问外链,可 打开说明文档 复制全文粘贴。文档会随站点更新,复制内容可能过期,建议定期检查。
基于VoxCPM2模型的波兰语文本转语音(TTS)服务器,支持声音克隆、REST API、多角色对话及Web管理界面,可通过Wyoming协议集成Home Assistant。
bashdocker run --gpus all -p 3000:3000 \ -v hf_cache:/root/.cache/huggingface \ -v ./voices:/app/voices \ docker.xuanyuan.run/toper666/topertts-voxcpm:latest
Web UI与API可通过 http://localhost:3000 访问。
[helena]/[hektor]标签切换角色,角色间自动添加停顿nvidia/cuda:13.0.3-runtime-ubuntu22.04)针对Blackwell架构(sm_120/sm_121,如RTX 50xx、GB10)优化,PyTorch 2.11 + CUDA 13.0支持JIT融合,确保生成速度。
yamlservices: voxcpm: image: docker.xuanyuan.run/toper666/topertts-voxcpm:latest ports: - "3000:3000" deploy: resources: reservations: devices: - driver: nvidia count: all capabilities: [gpu] volumes: - huggingface_cache:/root/.cache/huggingface - ./voices:/app/voices ipc: host ulimits: memlock: -1 stack: 67108864 restart: unless-stopped environment: - PYTORCH_CUDA_ALLOC_CONF=expandable_segments:True - TORCH_CUDA_ARCH_LIST=12.1 - TORCHDYNAMO_DISABLE=1 - TORCHINDUCTOR_DISABLE=1 volumes: huggingface_cache:
| 方法 | 端点 | 描述 |
|---|---|---|
| GET | / | Web UI(合成+管理) |
| GET | /api/voices | 可用声音列表 |
| POST | /api/tts | 语音合成(返回WAV音频) |
| POST | /api/admin/login | 管理员登录 |
| GET | /api/admin/voices | 管理员声音列表 |
| POST | /api/admin/voices | 添加克隆声音 |
| PUT | /api/admin/voices/{name} | 编辑声音 |
| DELETE | /api/admin/voices/{name} | 删除声音 |
管理员面板通过X-Admin-Password请求头验证密码。
| 变量 | 默认值 | 描述 |
|---|---|---|
| ADMIN_PASSWORD | — | 管理员密码(请设置自定义值) |
| VOXCPM_STOP_CONSECUTIVE | 2 | 触发停止的连续信号数 |
| VOXCPM_STOP_TOTAL_CAP | 6 | 停止信号振荡安全上限 |
| TORCHDYNAMO_DISABLE | 1 | Blackwell GPU必需 |
| PYTORCH_CUDA_ALLOC_CONF | expandable_segments:True | CUDA内存管理配置 |
参考声音通过/app/voices卷挂载,支持格式:.wav、.mp3、.flac、.m4a、.ogg,名称需符合[a-z0-9_-]{1,32}规则,也可通过Web UI添加/编辑/删除。
latest:最新稳定版本vX.Y.Z:具体版本号<sha>:对应提交的构建版本该镜像适用于波兰语语音生成与声音克隆场景,如家庭自动化(Home Assistant通知)等。
您可以使用以下命令拉取该镜像。请将 <标签> 替换为具体的标签版本。如需查看所有可用标签版本,请访问 标签列表页面。
来自真实用户的反馈,见证轩辕镜像的优质服务