ghcr.io/jim60105/whisperx

ghcr.io/jim60105/whisperx:medium-ca-c56400f

ghcr.iolinux/amd64medium-ca-c56400f大小: 11.13 GB更新于 2026年10月7日
让 AI 帮你使用轩辕镜像?

如果你使用 DeepSeek、元宝 AI、Copilot、ChatGPT 等 AI 工具,协助配置轩辕镜像、编写 docker pull 命令、修改 Docker Compose 镜像地址、配置镜像加速、排查镜像拉取失败、分析报错日志等问题,请先让 AI 阅读并遵守轩辕镜像的规则文档。

只需在 AI 对话中先发送下面这段话即可:

请先阅读并遵守:https://xuanyuan.cloud/agents.md

未读文档前不要生成 pull 命令或排错方案。

查看 agents.md 用法指南与完整示范。国内用户首推 元宝 AI、DeepSeek 的深度思考模式,不推荐豆包 AI;Cursor 等编辑器可在对话 @ 该链接,或加入 User Rules。 若 AI 无法访问外链,可 打开说明文档 复制全文粘贴。文档会随站点更新,复制内容可能过期,建议定期检查。

docker-whisperX

这是WhisperX的Docker镜像:社区版带词级时间戳(和说话人区分)的自动语音识别工具。

本项目的目标是在GitHub Free运行器上高效管理每周的持续集成Docker构建工作流。这包括并行构建175个Docker镜像,每个镜像大小为10GB。为确保平稳运行,我专注于高效利用Docker层缓存、最大化层复用、仔细管理缓存读写顺序以防止问题,并优化以最小化镜像大小和构建时间。

此外,出于个人偏好,我致力于尽我所能遵循最佳实践、行业标准和政策。

可在GitHub获取Dockerfile,或从ghcr.io拉取镜像。

🚀 准备支持GPU的Docker环境

Windows

安装Docker Desktop、CUDA Toolkit、NVIDIA Windows驱动程序,并确保Docker使用WSL2运行后,即可开始使用。

以下是官方文档供进一步参考:https://docs.nvidia.com/cuda/wsl-user-guide/index.html#nvidia-compute-software-support-on-wsl-2 https://docs.docker.com/desktop/wsl/use-wsl/#gpu-support

Linux, OSX

如果尚未安装NVIDIA GPU驱动程序,请先安装:https://docs.nvidia.com/datacenter/tesla/tesla-installation-notes/index.html

按照以下指南安装NVIDIA Container Toolkit:https://docs.nvidia.com/datacenter/cloud-native/container-toolkit/latest/install-guide.html

我有一篇关于此主题的中文博客:Fedora/RHEL的Podman GPU配置笔记

使用命令

将当前目录挂载为 /app 并使用额外的输入参数运行 WhisperX:

docker run --gpus all -it -v ".:/app" whisperx:large-v3-ja -- --output_format srt audio.mp3

请记住在参数前添加 --。--model 和 --language 参数已在 Dockerfile 中定义,无需指定。

  • LANG:要转录的语言。默认值为 en。请参见 https://github.com/jim60105/docker-whisperX/blob/master/load_align_model.py。
  • WHISPER_MODEL:模型名称。默认值为 base。请参见 https://huggingface.co/Systran 了解支持的模型。

如果需要多语言对齐,在构建镜像时使用空格分隔的语言列表 "LANG=pl fr en"。另请注意,WhisperX 在处理同一音频文件中的多种语言时表现不佳。即使不提供语言参数,它仍会识别语言(或回退到 en)并用于选择对齐模型。对齐模型是特定于语言的。此说明仅用于将多个对齐模型嵌入到 docker 镜像中。

构建命令

例如,如果要构建包含 en 语言和 large-v3 模型的镜像:

docker build --build-arg LANG=en --build-arg WHISPER_MODEL=large-v3 -t whisperx:large-v3-en .

如果要构建不包含任何预下载模型的镜像:

docker build --target no_model -t whisperx:no_model .

如果要一次性构建所有镜像,我们提供了 Docker bake 文件:

docker buildx bake build no_model

使用命令

将当前目录挂载为 /app 并使用额外的输入参数运行 WhisperX:

docker run --gpus all -it -v ".:/app" whisperx:large-v3-ja -- --output_format srt audio.mp3

[!NOTE] 请记住在参数前添加 --。--model 和 --language 参数在 Dockerfile 中已定义,无需指定。

📝 LICENSE

主程序 WhisperX 根据 https://github.com/m-bain/whisperX/blob/main/LICENSE 分发。 有关源代码和许可证的访问,请查阅其仓库。

本仓库中的 Dockerfile 和 CI 工作流文件根据 MIT 许可证 授权。

用户好评

来自真实用户的反馈,见证轩辕镜像的优质服务

用户头像

oldzhang

运维工程师

Linux服务器

5

"Docker访问体验非常流畅,大镜像也能快速完成下载。"

官方技术交流群:问题咨询请:提交工单
专业版 · 高速稳定拉取镜像
50GB 仅 ¥8/年
高速镜像下载在线技术支持99.95% SLA 保障付费会员免广告