轩辕镜像
轩辕镜像专业版
个人中心搜索镜像
交易
充值流量我的订单
工具
工单支持镜像收录Run 助手IP 归属地密码生成Npm 源Pip 源
帮助
常见问题我要吐槽
其他
关于我们网站地图

官方QQ群: 13763429

轩辕镜像
镜像详情
jbarlow83/ocrmypdf-alpine
官方博客使用教程热门镜像工单支持
本站面向开发者与科研用户,提供开源镜像的搜索和下载加速服务。
所有镜像均来源于原始开源仓库,本站不存储、不修改、不传播任何镜像内容。
轩辕镜像 - 国内开发者首选的专业 Docker 镜像下载加速服务平台 - 官方QQ群:13763429 👈点击免费获得技术支持。
本站面向开发者与科研用户,提供开源镜像的搜索和下载加速服务。所有镜像均来源于原始开源仓库,本站不存储、不修改、不传播任何镜像内容。

本站支持搜索的镜像仓库:Docker Hub、gcr.io、ghcr.io、quay.io、k8s.gcr.io、registry.gcr.io、elastic.co、mcr.microsoft.com

ocrmypdf-alpine Docker 镜像下载 - 轩辕镜像

ocrmypdf-alpine 镜像详细信息和使用指南

ocrmypdf-alpine 镜像标签列表和版本信息

ocrmypdf-alpine 镜像拉取命令和加速下载

ocrmypdf-alpine 镜像使用说明和配置指南

Docker 镜像加速服务 - 轩辕镜像平台

国内开发者首选的 Docker 镜像加速平台

极速拉取 Docker 镜像服务

相关 Docker 镜像推荐

热门 Docker 镜像下载

ocrmypdf-alpine
jbarlow83/ocrmypdf-alpine

ocrmypdf-alpine 镜像详细信息

ocrmypdf-alpine 镜像标签列表

ocrmypdf-alpine 镜像使用说明

ocrmypdf-alpine 镜像拉取命令

Docker 镜像加速服务

轩辕镜像平台优势

镜像下载指南

相关 Docker 镜像推荐

基于Alpine Linux的轻量级Docker镜像,集成OCRmyPDF工具,用于为扫描PDF文件添加OCR文本层,生成可搜索、可复制的PDF,保留原始布局,支持多语言识别。
2 收藏0 次下载activejbarlow83
🚀轩辕镜像专业版更稳定💎一键安装 Docker 配置镜像源
中文简介版本下载
🚀轩辕镜像专业版更稳定💎一键安装 Docker 配置镜像源

ocrmypdf-alpine 镜像详细说明

ocrmypdf-alpine 使用指南

ocrmypdf-alpine 配置说明

ocrmypdf-alpine 官方文档

OCRmyPDF (Alpine 基础镜像)

镜像概述

本镜像基于Alpine Linux构建,集成OCRmyPDF工具与Tesseract OCR引擎,提供轻量级PDF文件OCR处理能力。通过对扫描生成的图像PDF进行文本识别,自动添加可搜索、可复制的文本层,同时保留原始文档布局与格式,适用于文档数字化、档案管理等场景。

核心功能与特性

  • 轻量级基础:基于Alpine Linux,镜像体积小(约200MB),启动快速,资源占用低
  • 强大OCR引擎:集成Tesseract OCR引擎,支持高精度文本识别
  • 多语言支持:通过Tesseract语言包支持40+种语言(如英语、中文、日语、法语等)
  • 布局保留:OCR处理后严格保留原始PDF的排版、图像与格式
  • 智能处理:自动检测已包含文本层的PDF,跳过重复OCR操作
  • 可配置输出:支持调整压缩级别、分辨率、输出质量等参数

使用场景

  • 扫描PDF转换:将扫描仪生成的图像PDF转换为可搜索PDF(如合同、发票、书籍扫描件)
  • 文档数字化:企业/个人档案管理系统中,为纸质文档扫描件添加文本检索能力
  • 学术与研究:处理论文、期刊扫描件,支持关键词搜索与内容提取
  • 图书馆与档案:历史文献、档案数字化项目中,构建可检索的电子文档库

使用方法

基本用法

通过挂载本地目录至容器/data目录,指定输入PDF与输出PDF路径即可执行OCR处理:

docker run --rm -v $(pwd):/data ocrmypdf-alpine input.pdf output.pdf

说明:--rm 确保容器退出后自动删除;-v $(pwd):/data 将当前目录挂载至容器内/data目录,实现文件共享

常用参数示例

指定识别语言

通过-l参数指定1种或多种识别语言(语言代码见Tesseract语言列表):

# 中英双语识别
docker run --rm -v $(pwd):/data ocrmypdf-alpine -l eng+chi_sim input.pdf output.pdf

优化输出质量

调整压缩级别与分辨率,平衡文件大小与清晰度:

# 高分辨率输出(300dpi)+ 低压缩
docker run --rm -v $(pwd):/data ocrmypdf-alpine --dpi 300 --output-type pdfa --jpeg-quality 90 input.pdf output.pdf

批量处理

通过shell命令批量处理目录内所有PDF文件:

for file in ./input/*.pdf; do
  docker run --rm -v $(pwd):/data ocrmypdf-alpine "input/$(basename $file)" "output/$(basename $file)" -l eng
done

环境变量配置

环境变量说明默认值
OCRMYPDF_LANGUAGE默认OCR识别语言(多语言用+分隔)eng(英语)
TESSDATA_PREFIXTesseract语言数据文件路径/usr/share/tesseract-ocr/4.00/tessdata

扩展配置

添加额外语言包

默认包含英语语言包,如需其他语言,可通过挂载本地Tesseract语言文件实现:

  1. 从Tesseract tessdata仓库下载语言包(如chi_sim.traineddata中文包)
  2. 挂载语言文件至容器Tesseract数据目录:
docker run --rm -v $(pwd):/data -v $(pwd)/tessdata:/usr/share/tesseract-ocr/4.00/tessdata ocrmypdf-alpine -l chi_sim input.pdf output.pdf

Docker Compose配置

创建docker-compose.yml简化重复任务:

version: '3'
services:
  ocrmypdf:
    image: ocrmypdf-alpine
    volumes:
      - ./input:/data/input    # 输入PDF目录
      - ./output:/data/output  # 输出PDF目录
      - ./tessdata:/usr/share/tesseract-ocr/4.00/tessdata  # 自定义语言包
    command: input/scan.pdf output/scan_ocr.pdf -l eng+chi_sim --dpi 300

执行:docker-compose up

注意事项

  • 文件权限:确保挂载目录对容器内用户有读写权限(建议本地目录权限设置为755)
  • 大文件处理:处理超过100页的PDF时,建议通过--memory=4g限制容器内存使用
  • 图像质量:低分辨率扫描件(<200dpi)可能导致OCR识别准确率下降,建议预处理提升图像清晰度
查看更多 ocrmypdf-alpine 相关镜像 →
alpine/git logo
alpine/git
by alpine
这是一个运行于Alpine Linux系统中的简易Git容器,Alpine Linux以其极致精简的特性为基础,使得该容器在保持Git核心功能的同时,具备轻量高效的运行表现,尤其适用于各类小型Linux发行版环境,能够满足资源受限场景下的版本控制需求,为嵌入式系统、边缘设备或轻量级开发环境提供便捷的Git服务支持。
245100M+ pulls
上次更新:1 天前
alpine/socat logo
alpine/socat
by alpine
基于Alpine的轻量级容器,用于运行socat网络工具,实现端口转发、数据流转发等网络通信功能。
11450M+ pulls
上次更新:2 天前
alpine/helm logo
alpine/helm
by alpine
当Kubernetes Helm有新发布时自动触发Docker构建的镜像
6950M+ pulls
上次更新:8 天前

常见问题

轩辕镜像免费版与专业版有什么区别?

免费版仅支持 Docker Hub 加速,不承诺可用性和速度;专业版支持更多镜像源,保证可用性和稳定速度,提供优先客服响应。

轩辕镜像免费版与专业版有分别支持哪些镜像?

免费版仅支持 docker.io;专业版支持 docker.io、gcr.io、ghcr.io、registry.k8s.io、nvcr.io、quay.io、mcr.microsoft.com、docker.elastic.co 等。

流量耗尽错误提示

当返回 402 Payment Required 错误时,表示流量已耗尽,需要充值流量包以恢复服务。

410 错误问题

通常由 Docker 版本过低导致,需要升级到 20.x 或更高版本以支持 V2 协议。

manifest unknown 错误

先检查 Docker 版本,版本过低则升级;版本正常则验证镜像信息是否正确。

镜像拉取成功后,如何去掉轩辕镜像域名前缀?

使用 docker tag 命令为镜像打上新标签,去掉域名前缀,使镜像名称更简洁。

查看全部问题→

轩辕镜像下载加速使用手册

探索更多轩辕镜像的使用方法,找到最适合您系统的配置方式

🔐

登录方式进行 Docker 镜像下载加速教程

通过 Docker 登录方式配置轩辕镜像加速服务,包含7个详细步骤

🐧

Linux Docker 镜像下载加速教程

在 Linux 系统上配置轩辕镜像源,支持主流发行版

🖥️

Windows/Mac Docker 镜像下载加速教程

在 Docker Desktop 中配置轩辕镜像加速,适用于桌面系统

📦

Docker Compose 镜像下载加速教程

在 Docker Compose 中使用轩辕镜像加速,支持容器编排

📋

K8s containerd 镜像下载加速教程

在 k8s 中配置 containerd 使用轩辕镜像加速

🔧

宝塔面板 Docker 镜像下载加速教程

在宝塔面板中配置轩辕镜像加速,提升服务器管理效率

💾

群晖 NAS Docker 镜像下载加速教程

在 Synology 群晖NAS系统中配置轩辕镜像加速

🐂

飞牛fnOS Docker 镜像下载加速教程

在飞牛fnOS系统中配置轩辕镜像加速

📱

极空间 NAS Docker 镜像下载加速教程

在极空间NAS中配置轩辕镜像加速

⚡

爱快路由 ikuai Docker 镜像下载加速教程

在爱快ikuai系统中配置轩辕镜像加速

🔗

绿联 NAS Docker 镜像下载加速教程

在绿联NAS系统中配置轩辕镜像加速

🌐

威联通 NAS Docker 镜像下载加速教程

在威联通NAS系统中配置轩辕镜像加速

📦

Podman Docker 镜像下载加速教程

在 Podman 中配置轩辕镜像加速,支持多系统

📚

ghcr、Quay、nvcr、k8s、gcr 等仓库下载镜像加速教程

配置轩辕镜像加速9大主流镜像仓库,包含详细配置步骤

🚀

专属域名方式进行 Docker 镜像下载加速教程

无需登录即可使用轩辕镜像加速服务,更加便捷高效

需要其他帮助?请查看我们的 常见问题 或 官方QQ群: 13763429

商务:17300950906
|©2024-2025 源码跳动
商务合作电话:17300950906|Copyright © 2024-2025 杭州源码跳动科技有限公司. All rights reserved.