轩辕镜像 官方专业版
轩辕镜像
专业版
轩辕镜像 官方专业版
轩辕镜像
专业版
首页个人中心搜索镜像
交易
充值流量¥8起我的订单
文档
工具
提交工单页面收录
ghcr.io/luce-org/lucebox-hub

ghcr.io/luce-org/lucebox-hub:sha-9cca94c-rocm

ghcr.iolinux/amd64sha-9cca94c-rocm大小: 6.28 GB更新于 2026年10月7日
让 AI 帮你使用轩辕镜像? · 展开查看说明 · 点击收起说明

如果你使用 DeepSeek、元宝 AI、Copilot、ChatGPT 等 AI 工具,协助配置轩辕镜像、编写 docker pull 命令、修改 Docker Compose 镜像地址、配置镜像加速、排查镜像拉取失败、分析报错日志等问题,请先让 AI 阅读并遵守轩辕镜像的规则文档。

只需在 AI 对话中先发送下面这段话即可:

请先阅读并遵守:https://xuanyuan.cloud/agents.md

未读文档前不要生成 pull 命令或排错方案。

查看 agents.md 用法指南与完整示范。国内用户首推 元宝 AI、DeepSeek 的深度思考模式,不推荐豆包 AI;Cursor 等编辑器可在对话 @ 该链接,或加入 User Rules。 若 AI 无法访问外链,可 打开说明文档 复制全文粘贴。文档会随站点更新,复制内容可能过期,建议定期检查。

镜像名称:ghcr.io/luce-org/lucebox-hub 参考标签:latest

面向异构设备与消费级 GPU 的推测推理方案。 内置自定义内核、推测式预填充与解码逻辑,针对每一款模型与硬件目标完成专属调优。


推理引擎优化特性

优化项实测环境结果
DFlash2单张 R9700 运行 Qwen 3.8 27B平均 208.1 tok/s,峰值 227.8 tok/s
DSparkStrix Halo 运行 DeepSeek V4,采用原生 top-6 配置高接受率中位数 32.7 tok/s;混合评估平均 27.9 tok/s
PFlash + KVFlashRTX 3090 运行上下文长度 256K 的 Laguna XS 2.1 33B预填充速度提升 6.1×,耗时从 411 s 降至 67.3 s
Luce SparkRTX 3090 运行 Laguna XS.2 33B显存占用 14.6 GiB,速度约 100 tok/s
KVFlashRTX 3090 运行上下文长度 256K 的 Laguna XS 2.1 33B搭配 8K 缓存池时速度 152.3 tok/s
异构执行R9700 + Strix Halo 运行 DeepSeek V4解码速度 86 tok/s;2K 上下文下预填充速度 788 tok/s
分页注意力 + 连续批处理R9700 运行 Qwen 3.8 27B + DFlash2;Strix Halo 运行 DeepSeek V4 Flash AR5 客户端并发(Qwen)总速度 300.9 tok/s;4 客户端并发(DeepSeek)输出窗口速度 48.4 tok/s
三层专家调度R9700 + Strix Halo + SSD 运行 DeepSeek V4.1 Flash代码场景解码速度 25-26 tok/s;在配置文件指定的 128K 上下文下,4K 预填充速度 118-121 tok/s
巨内核RTX 3090 运行 Qwen 3.5 0.8B速度 413 tok/s,能效比 1.87 tok/J
视觉(图像输入)R9700 运行 Qwen 3.8 27B 视觉模型 + Strix Halo 运行 DeepSeek V4 Flash 视觉模型,双机协同图文问答吞吐量是 DGX Spark 的 3.2×(每分钟 58 次 vs 18 次);同模型文件在 8 用户并发场景下速度快 2.4×

支持的模型与草稿器

每个徽章可跳转至实测环境所使用的完整权重文件。草稿器徽章将跳转至已发布的量化版本,若需额外转换则跳转至源检查点。

模型🤗 权重优化项(博客链接)阶段结果
Qwen 3.5 0.8B预填充 + 解码预填充速度 1.9×;解码速度 1.55×
R9700 上的 Qwen 3.8 27B解码是 Lucebox AR 速度的 6.4×;使用相同草稿器时是 llama.cpp 速度的 3.8×
Laguna XS 2.1 33B预填充256K 上下文下速度提升 6.1×,耗时从 411 s 降至 67.3 s
Laguna XS 2.1 33B解码256K 上下文下速度 1.7×
Gemma 4 26B-A4B解码速度 1.31×
Gemma 4 31B IT解码速度 3.2×
Strix Halo 上的 DeepSeek V4 Flash解码8K 上下文下速度 42 tok/s;纯启动配置下代码与数学场景速度 39 tok/s(对应 https://github.com/Luce-Org/lucebox/pull/729)
R9700 + Strix Halo + SSD,带 --profile ds41-lucebox 的 DeepSeek V4.1 Flash解码在配置文件指定的 128K 上下文下,代码场景速度 25.4-25.8 tok/s;4K 提示词处理后速度 16.8-17.5 tok/s(对应 指南)
R9700 + Ryzen AI Max+ PRO 495 192 GB,带 --profile ds41-gorgon 的 DeepSeek V4.1 Flash预填充 + 解码14K-25K 上下文下预填充速度 985-1019 tok/s;所有专家常驻显存时代码场景解码速度 48.7 tok/s(对应 指南)
DGX Spark 上的 Ling 3.0 Flash 124B-A5.1B自回归解码自回归场景中位数速度 34.6 tok/s
R9700 上的 Qwen 3.8 27B 视觉模型图文问答8 用户并发时是 DGX Spark 上 llama.cpp 速度的 2.4×(耗时 10.5 s vs 25.4 s);单用户场景下速度 2.1×
R9700 上的 DeepSeek V4 Flash Visual 编码器,4 用户并发图文问答由 R9700 执行编码时,处理 16 张图像的首 token 生成速度快 1.5×

已测试硬件(GPU/APU)

本引擎不绑定单一参考显卡。NVIDIA 架构可通过 CMake 选项指定;HIP 构建版本需针对设备对应的精确 gfx 架构生成。

架构硬件运行时详情
RDNA4 gfx1201Radeon AI PRO R9700ROCm 7.2Qwen 3.8 R9700 快速入门
RDNA3.5 gfx1151Ryzen AI MAX+ 395 / Strix HaloROCm 7.2DeepSeek V4 Strix 配置文件
RDNA3 gfx1100Radeon RX 7900 XT / XTXROCm 6+DeepSeek V4 双 AMD 设备配置文件
Ampere sm_86RTX 3090CUDA 12+https://github.com/Luce-Org/lucebox/pull/637 与 巨内核测试结果
Blackwell sm_120RTX 5090CUDA 12.8+https://github.com/Luce-Org/lucebox/pull/637
Blackwell sm_121DGX Spark / GB10CUDA 12.9Qwen 3.5 NVFP4 测试结果
Ada sm_89RTX 4090CUDA 12+Linux 社区测试 与 WSL2 社区测试
Turing sm_75RTX 2080 TiCUDA 12.0DFlash 测试结果
Volta sm_70、Pascal sm_61V100、P40CUDA 12.0CUDA 快速入门
未展示Blackwell sm_110Jetson AGX ThorCUDA 13.0Thor 快速入门

单设备测试结果

硬件模型实测结果
R9700https://huggingface.co/unsloth/Qwen3.8-27B-GGUF/blob/main/Qwen3.8-27B-UD-IQ4_XS.gguf + https://huggingface.co/incoai/Qwen3.8-27B-DFlash2/blob/main/model.safetensorsHumanEval 基准平均 208.1 tok/s;最佳单请求速度 227.8 tok/s
RTX 5090Qwen 3.8 27B处理 26758 token 提示词 + 1024 token 续写任务时速度 110.6 tok/s(对应 https://github.com/Luce-Org/lucebox/pull/637)

异构与并行测试结果

硬件配置实测结果
2x RTX 3090 + NVLinkQwen 3.8 目标模型张量并行 + DFlash2速度 79.7 tok/s,是自回归解码速度的 2.16×(对应 https://github.com/Luce-Org/lucebox/pull/637)
RX 7900 XT + Strix HaloDeepSeek V4 启用全部 6 个专家 + DSpark 校验宽度 4解码速度 45.0~47.7 tok/s;*** token 上下文下预填充速度 111.2 tok/s(对应 https://github.com/Luce-Org/lucebox/pull/604#qualified-results)
R9700 + Strix HaloDeepSeek V4 跨两台 AMD 设备分布式运行解码速度 86 tok/s;2K 上下文下预填充速度 788 tok/s

以上测试使用了不同的提示词、量化方案与推理策略,仅用于验证对应配置的可用性,不代表跨硬件性能排名。

推荐配置方案

有关模型与硬件适配矩阵(包括单 GPU 与混合 GPU 配置文件)的内容,请参阅 推荐服务器配置。

DS4 指南中还记录了 Strix 长上下文稀疏验证器配置文件,以及 Qwen3-0.6B PFlash 集成方案。PFlash 是有损提示压缩技术;若需执行精确检索或真实上下文匹配基准测试,请将其关闭。

客户端测试套件

harness/ 目录可通过主流编码客户端运行 Lucebox,并校验服务器兼容性。

客户端启动器
Claude Coderun_claude_code.sh
Codexrun_codex.sh
OpenCoderun_opencode.sh
Hermesrun_hermes.sh
OMPrun_omp.sh
Pirun_pi.sh
OpenClawrun_openclaw.sh
Open WebUIrun_openwebui.sh

请先设置服务器二进制文件与模型路径,再运行对应启动器:

LUCE_SERVER_BIN=server/build/luce_server \
LUCE_TARGET=server/models/Qwen3.8-27B-UD-IQ4_XS.gguf \
LUCE_DRAFT=server/models/draft/qwen38-dflash2-q8_0.gguf \
MAX_CTX=32768 \
harness/clients/run_codex.sh

有关环境配置、无 draft 目标与基准测试的内容,请参阅 测试套件指南。

Docker 快速入门

GHCR 上的预构建镜像会跟踪 main 分支。挂载模型权重后,即可在 :8000 端口提供兼容 OpenAI 规范的 API 服务。

GPU镜像标签
NVIDIA(CUDA 12+):cuda12
AMD(ROCm 6+):rocm

请将主模型文件放置在 server/models/ 目录下,对应的 draft 模型文件放置在 server/models/draft/ 目录下。

根据所用 GPU 运行对应镜像:

# NVIDIA 设备
docker run --rm --gpus all -p 8000:8080 \
-v "$PWD/server/models:/opt/lucebox-hub/server/models" \
ghcr.io/luce-org/lucebox-hub:cuda12

# AMD 设备
docker run --rm --device /dev/kfd --device /dev/dri \
--group-add video --group-add render --security-opt seccomp=unconfined \
-p 8000:8080 -v "$PWD/server/models:/opt/lucebox-hub/server/models" \
ghcr.io/luce-org/lucebox-hub:rocm

容器会自动选择可容纳目标模型的 GPU(优先选用独立显卡而非核显,均不满足时选用显存最大的设备),并根据该 GPU 的显存自动设置上下文大小。serve 是默认命令,你可以直接在镜像名称后追加 luce_server 参数(也可以显式指定 serve),传入的参数会覆盖容器默认值。--target-device、--max-ctx 和 --profile 等参数均支持直接使用:

# 列出所有 GPU、模型信息与自动放置逻辑选定的设备
docker run --rm -v ... ghcr.io/luce-org/lucebox-hub:rocm devices

# 在 Strix Halo 上以适配配置文件运行 DeepSeek V4(DSpark draft 模型位于 models/draft/ 目录下)
docker run --rm -p 8000:8080 -v ... ghcr.io/luce-org/lucebox-hub:rocm --profile ds4-strix

# 手动指定绑定设备
docker run --rm -p 8000:8080 -v ... ghcr.io/luce-org/lucebox-hub:rocm --target-device hip:1

LUCE_TARGET、LUCE_TARGET_DEVICE、LUCE_MAX_CTX 与 LUCE_ARGS 等环境变量可在 compose 文件中实现相同的配置效果,详见 server/scripts/entrypoint.sh 的头部说明。

运行服务器

本快速入门示例将运行上文提到的 R9700 配置文件。完整的参数参考请查看 服务器指南。

# 编译(ROCm 7.2+,RDNA4 架构)
git clone --recurse-submodules https://github.com/Luce-Org/lucebox.git
cd lucebox
cmake -S server -B server/build-hip -G Ninja \
-DCMAKE_BUILD_TYPE=Release \
-DCMAKE_HIP_COMPILER=/opt/rocm/lib/llvm/bin/clang++ \
-DLUCE_GPU_BACKEND=hip \
-DLUCE_HIP_ARCHITECTURES=gfx1201 \
-DGGML_HIP_MMQ_MFMA=ON \
-DGGML_HIP_NO_VMM=ON
cmake --build server/build-hip --target luce_server -j"$(nproc)"

# 准备主模型与 DFlash2 draft 模型
mkdir -p models
huggingface-cli download unsloth/Qwen3.8-27B-GGUF \
Qwen3.8-27B-UD-IQ4_XS.gguf --local-dir models
huggingface-cli download incoai/Qwen3.8-27B-DFlash2 --local-dir models/dflash2
python server/scripts/convert_dflash_to_gguf.py \
models/dflash2/model.safetensors models/qwen38-dflash2-f16.gguf
python server/scripts/quantize_dflash_draft.py \
models/qwen38-dflash2-f16.gguf models/qwen38-dflash2-q8_0.gguf --scheme q8_0

# 运行适配好的配置文件
./server/build-hip/luce_server models/Qwen3.8-27B-UD-IQ4_XS.gguf \
--draft models/qwen38-dflash2-q8_0.gguf \
--draft-block-size 16 --max-ctx 131072 \
--cache-type-k q8_0 --cache-type-v q8_0 \
--port 8216

curl -s http://127.0.0.1:8216/v1/chat/completions \
-H 'Content-Type: application/json' \
-d '{"messages":[{"role":"user","content":"Write a Python LRU cache."}],
"max_tokens":256,"temperature":0}'

若要支持最多 N 个并发请求,可使用以下启动命令(基于相同的 Qwen 主模型与 DFlash2 draft 模型)。请将 N 替换为所需的并发数(示例中设为 5),Qwen 会根据可用 GPU 显存自动调整共享 KV 池的大小。

N=5
./server/build-hip/luce_server models/Qwen3.8-27B-UD-IQ4_XS.gguf \
--draft models/qwen38-dflash2-q8_0.gguf \
--draft-block-size 16 --max-ctx 16384 \
--paged-attention --max-concurrency "$N" \
--cache-type-k q8_0 --cache-type-v q8_0 \
--port 8216

有关 Qwen 与 DeepSeek V4 Flash 的实测结果、延迟数据与启动设置,请参阅 Lucebox 中的连续批处理。

文档

主题指南
推荐模型与硬件配置文件推荐配置
运行时参数服务器参数参考
OpenAI 聊天补全、Responses 接口与 Anthropic Messages 接口API 参考
CUDA、HIP 与混合设备部署混合后端指南
DeepSeek V4 单设备与异构配置文件DeepSeek V4 指南
在 R9700 + Strix Halo + SSD 上运行 DeepSeek V4.1 FlashDeepSeek V4.1 指南
图像输入(支持 Qwen3.8、DeepSeek V4 Flash Vision)图像输入指南
环境变量环境参考
服务器内部实现架构说明
客户端集成与适配认证测试套件指南
服务器引擎组件引擎组件

各专项优化的基准测试结果随对应实现一同发布:DFlash、PFlash、Spark、KVFlash 与 Megakernel。


教程

提供各优化项与测试套件配置的视频教程。

Luce KVFlash ▶ ***

Lucebox 专用设备

本地 AI 应当是默认选项,而非少数人才享有的特权。全程数据留存在本地、无按 Token 计费、也不存在厂商锁定。Lucebox 将 R9700 与 Strix Halo 搭配,交付预配置就绪、可直接运行的开源引擎。

你可以访问 lucebo*** 查看硬件详情和当前基准测试结果。


征集贡献

我们欢迎来自社区的定向贡献,贡献范围涵盖 CUDA 与 HIP 内核、投机推理、更多消费级 GPU 和 APU 的适配支持、性能基准测试以及客户端测试套件。


引用

@software{lucebox_2026,
title = {Lucebox: Speculative inference for heterogeneous consumer hardware},
author = {Lucebox},
url = {https://github.com/Luce-Org/lucebox},
year = {2026}
}

社区

  • *******: ***.gg/yHfswqZmJQ
  • 官网: lucebo***
  • Issue 反馈: https://github.com/Luce-Org/lucebox/issues
  • 博客: lucebo***/blog

Apache 2.0 许可 · Lucebo***

轩辕镜像配置手册

按平台快速找到配置文档

一键安装

一键安装 Docker

Linux Docker 一键安装

AI

用 AI 使用轩辕镜像

agents.md · AI 对话 · 提示词

Docker

登录仓库拉取

登录认证 · 私有仓库

专属域名拉取

免登录 · 高速拉取

Linux

Docker 镜像配置

Windows / Mac

Docker Desktop 配置

MacOS OrbStack

OrbStack 容器

Apple Container

macOS 原生容器

Docker Compose

Compose 项目配置

NAS

群晖

Synology 配置

飞牛

fnOS 镜像配置

绿联

绿联 NAS

威联通

QNAP 配置

极空间

极空间 NAS

Unraid

Unraid NAS

企业仓库

其他仓库

ghcr · Quay · nvcr

Harbor 镜像源

Proxy Repository 对接

Portainer 镜像源

Registries 配置

Nexus 镜像源

Docker Proxy 缓存

开发工具

Dev Containers

VS Code 开发容器

Podman

Podman 配置指南

Singularity / Apptainer

HPC 科学计算容器

Kubernetes

K8s Containerd

Kubernetes · Containerd

K3s

轻量级集群

面板 / 网络

爱快路由

爱快 4.0 · iKuai 镜像加速

宝塔面板

一键配置镜像源

需要其他帮助?请查看我们的 常见问题Docker 镜像访问常见问题解答 或 提交工单

镜像拉取常见问题

功能

版本功能对比

功能对比 · 版本选择

支持的镜像仓库

Docker Hub · GCR · GHCR

专属域名用法

专属域名 · 开启停用 · 多仓库

新手拉取配置

登录 · 专属域名 · 配置

docker search 限制

专属域名 · Hub 搜索

不支持 push

仅支持 pull · 不支持

拉取速度原因

带宽 · 缓存 · 冷热镜像

错误码

402 与流量用尽

402 · 流量包 · 充值

401 认证失败

401 · docker login

manifest unknown

标签错误 · 镜像不存在

410 Gone 排查

410 · Docker 升级

429 限流

免费版 · 专业版 · 企业版 · 请求频率

其他报错

DNS 超时

DNS 解析 · 网络超时

TLS 证书失败

no matching manifest(架构)

docker.sock / daemon

账号

失败是否计费

manifest · blob · 计费

申请开票(企业 / 个人)

开票 · 发票 · 工单

修改登录密码

网站 · 仓库 · 重置

注销账户

工单 · 数据 · 注销

原理

mirrors 不生效

daemon.json · 重启

去掉域名前缀

docker tag · 重命名

指定架构拉取

ARM64 · AMD64 · 多架构

latest 与「最新」

digest · 版本号 · 标签

查看全部问题→

用户好评

来自真实用户的反馈,见证轩辕镜像的优质服务

用户头像

oldzhang

运维工程师

Linux服务器

5

"Docker访问体验非常流畅,大镜像也能快速完成下载。"

轩辕镜像
镜像详情
...
ghcr.io/luce-org/lucebox-hub
定价查看流量套餐与价格
博客Docker 镜像公告与技术博客
官方技术交流群:|问题咨询请:提交工单
服务号:轩辕镜像|公众号:源码跳动|小程序:轩辕镜像|官方技术交流群:|问题咨询请:提交工单
专业版 · 高速稳定拉取镜像
高速镜像下载·在线技术支持·99.95% SLA 保障·付费会员免广告
50GB 仅 ¥8/年
专业版 · 高速稳定拉取镜像
50GB 仅 ¥8/年
高速镜像下载·在线技术支持·99.95% SLA 保障·付费会员免广告
用户协议·隐私政策·增值电信业务经营许可证:浙B2-20261007·©2024-2026 源码跳动©2024-2026 杭州源码跳动科技有限公司·商务合作:点击复制邮箱