如果你使用 DeepSeek、元宝 AI、Copilot、ChatGPT 等 AI 工具,协助配置轩辕镜像、编写 docker pull 命令、修改 Docker Compose 镜像地址、配置镜像加速、排查镜像拉取失败、分析报错日志等问题,请先让 AI 阅读并遵守轩辕镜像的规则文档。
只需在 AI 对话中先发送下面这段话即可:
请先阅读并遵守:https://xuanyuan.cloud/agents.md
未读文档前不要生成 pull 命令或排错方案。查看 agents.md 用法指南与完整示范。国内用户首推 元宝 AI、DeepSeek 的深度思考模式,不推荐豆包 AI;Cursor 等编辑器可在对话 @ 该链接,或加入 User Rules。 若 AI 无法访问外链,可 打开说明文档 复制全文粘贴。文档会随站点更新,复制内容可能过期,建议定期检查。
这是WhisperX的Docker镜像:社区版带词级时间戳(和说话人区分)的自动语音识别工具。
本项目的目标是在GitHub Free运行器上高效管理每周的持续集成Docker构建工作流。这包括并行构建175个Docker镜像,每个镜像大小为10GB。为确保平稳运行,我专注于高效利用Docker层缓存、最大化层复用、仔细管理缓存读写顺序以防止问题,并优化以最小化镜像大小和构建时间。
此外,出于个人偏好,我致力于尽我所能遵循最佳实践、行业标准和政策。
可在GitHub获取Dockerfile,或从ghcr.io拉取镜像。
安装Docker Desktop、CUDA Toolkit、NVIDIA Windows驱动程序,并确保Docker使用WSL2运行后,即可开始使用。
以下是官方文档供进一步参考:https://docs.nvidia.com/cuda/wsl-user-guide/index.html#nvidia-compute-software-support-on-wsl-2 https://docs.docker.com/desktop/wsl/use-wsl/#gpu-support
如果尚未安装NVIDIA GPU驱动程序,请先安装:https://docs.nvidia.com/datacenter/tesla/tesla-installation-notes/index.html
按照以下指南安装NVIDIA Container Toolkit:https://docs.nvidia.com/datacenter/cloud-native/container-toolkit/latest/install-guide.html
我有一篇关于此主题的中文博客:Fedora/RHEL的Podman GPU配置笔记
将当前目录挂载为 /app 并使用额外的输入参数运行 WhisperX:
docker run --gpus all -it -v ".:/app" whisperx:large-v3-ja -- --output_format srt audio.mp3
请记住在参数前添加 --。--model 和 --language 参数已在 Dockerfile 中定义,无需指定。
LANG:要转录的语言。默认值为 en。请参见 https://github.com/jim60105/docker-whisperX/blob/master/load_align_model.py。WHISPER_MODEL:模型名称。默认值为 base。请参见 https://huggingface.co/Systran 了解支持的模型。如果需要多语言对齐,在构建镜像时使用空格分隔的语言列表 "LANG=pl fr en"。另请注意,WhisperX 在处理同一音频文件中的多种语言时表现不佳。即使不提供语言参数,它仍会识别语言(或回退到 en)并用于选择对齐模型。对齐模型是特定于语言的。此说明仅用于将多个对齐模型嵌入到 docker 镜像中。
例如,如果要构建包含 en 语言和 large-v3 模型的镜像:
docker build --build-arg LANG=en --build-arg WHISPER_MODEL=large-v3 -t whisperx:large-v3-en .
如果要构建不包含任何预下载模型的镜像:
docker build --target no_model -t whisperx:no_model .
如果要一次性构建所有镜像,我们提供了 Docker bake 文件:
docker buildx bake build no_model
将当前目录挂载为 /app 并使用额外的输入参数运行 WhisperX:
docker run --gpus all -it -v ".:/app" whisperx:large-v3-ja -- --output_format srt audio.mp3
[!NOTE] 请记住在参数前添加
--。--model和--language参数在 Dockerfile 中已定义,无需指定。
主程序 WhisperX 根据 https://github.com/m-bain/whisperX/blob/main/LICENSE 分发。 有关源代码和许可证的访问,请查阅其仓库。
本仓库中的 Dockerfile 和 CI 工作流文件根据 MIT 许可证 授权。
来自真实用户的反馈,见证轩辕镜像的优质服务