轩辕镜像 官方专业版
轩辕镜像
专业版
轩辕镜像 官方专业版
轩辕镜像
专业版
首页个人中心搜索镜像
交易
充值流量¥8起我的订单
文档
工具
提交工单页面收录
ghcr.io/luce-org/lucebox-hub

ghcr.io/luce-org/lucebox-hub:sha-8ac9fe4-rocm

ghcr.iolinux/amd64sha-8ac9fe4-rocm大小: 6.27 GB更新于 2026年9月7日
让 AI 帮你使用轩辕镜像? · 展开查看说明 · 点击收起说明

如果你使用 DeepSeek、元宝 AI、Copilot、ChatGPT 等 AI 工具,协助配置轩辕镜像、编写 docker pull 命令、修改 Docker Compose 镜像地址、配置镜像加速、排查镜像拉取失败、分析报错日志等问题,请先让 AI 阅读并遵守轩辕镜像的规则文档。

只需在 AI 对话中先发送下面这句话即可:

请先完整阅读并严格遵守以下文档中的全部规则与要求:

https://xuanyuan.cloud/agents.md

在未充分阅读并理解该文档前,不要生成任何命令、配置、修改建议、故障排查方案或技术回答。后续所有输出都必须严格以该文档中的规范为最高优先级执行。

查看 agents.md 用法指南与完整示范。国内用户首推 元宝 AI、DeepSeek 的深度思考模式,不推荐豆包 AI;Cursor 等编辑器可在对话 @ 该链接,或加入 User Rules。 若 AI 无法访问外链,可 打开说明文档 复制全文粘贴。文档会随站点更新,复制内容可能过期,建议定期检查。

面向异构机器和消费级GPU的推测式推理。自定义内核、推测式预填充和解码,针对每个模型和硬件目标进行优化。


推理引擎优化

优化项测试配置结果
DFlash2单张R9700上的Qwen 3.8 27B平均208.1 tok/s,峰值227.8 tok/s
DSparkStrix Halo上的DeepSeek V4,原生top-6高接受度中位数32.7 tok/s;混合评估平均27.9 tok/s
PFlash + KVFlashRTX 3090上256K上下文的Laguna XS 2.1 33B预填充6.1×,耗时从411秒降至67.3秒
Luce SparkRTX 3090上的Laguna XS.2 33B14.6 GiB内存占用下~100 tok/s
KVFlashRTX 3090上256K上下文的Laguna XS 2.1 33B8K池配置下152.3 tok/s
Heterogeneous executionR9700 + Strix Halo上的DeepSeek V4解码86 tok/s;2K上下文预填充788 tok/s
Paged attentionQwen 3.6 27B并发服务注意力步骤1.35×;KV内存减少82%
MegakernelRTX 3090上的Qwen 3.5 0.8B413 tok/s,1.87 tok/J

支持的模型和草稿模型

模型链接指向测试配置使用的确切权重。草稿模型链接指向已发布的量化版本,或需要转换时的源检查点。

模型与优化项阶段加速比
https://huggingface.co/Qwen/Qwen3.5-0.8B/blob/main/model.safetensors-00001-of-00001.safetensors + Megakernel预填充+解码预填充1.9×;解码1.55×
https://huggingface.co/unsloth/Qwen3.8-27B-GGUF/blob/main/Qwen3.8-27B-UD-IQ4_XS.gguf + https://huggingface.co/incoai/Qwen3.8-27B-DFlash2/blob/main/model.safetensors(转换为Q8_0格式,运行于R9700)解码较Lucebox AR6.4×;较同草稿模型的llama.cpp3.8×
https://huggingface.co/poolside/Laguna-XS-2.1-GGUF/blob/main/Laguna-XS-2.1-Q4_K_M.gguf + PFlash/KVFlash(搭配https://huggingface.co/Qwen/Qwen3-0.6B-GGUF/blob/main/Qwen3-0.6B-Q8_0.gguf)预填充6.1×,256K上下文耗时从411秒降至67.3秒
https://huggingface.co/poolside/Laguna-XS-2.1-GGUF/blob/main/Laguna-XS-2.1-Q4_K_M.gguf + https://huggingface.co/Lucebox/Laguna-XS-2.1-DFlash-GGUF/blob/main/laguna-xs21-dflash-q4.gguf解码256K上下文下1.7×
https://huggingface.co/bartowski/google_gemma-4-26B-A4B-it-GGUF/blob/main/google_gemma-4-26B-A4B-it-Q4_K_M.gguf + https://huggingface.co/Lucebox/gemma-4-26B-A4B-it-DFlash-GGUF/blob/main/gemma-4-26B-A4B-it-DFlash-q8_0.gguf解码1.31×
https://huggingface.co/bartowski/google_gemma-4-31B-it-GGUF/blob/main/google_gemma-4-31B-it-Q4_K_M.gguf + https://huggingface.co/Lucebox/gemma-4-31B-it-DFlash-GGUF/blob/main/gemma-4-31B-it-DFlash-q8_0.gguf解码3.2×
https://huggingface.co/Lucebox/DeepSeek-V4-Flash-0731-ROCmFP3/blob/main/DeepSeek-V4-Flash-0731-ROCMFPX-MIX-STRIX.gguf + https://huggingface.co/Lucebox/DeepSeek-V4-Flash-0731-DSpark-GGUF/blob/main/DeepSeek-V4-Flash-0731-DSpark-draft-Q4RMFP4-denseF16.gguf解码较纯目标模型最高1.81×(32.7 vs 18.1 tok/s)
https://huggingface.co/bloomer010/Ling-3.0-flash-GGUF解码DGX Spark上AR中位数34.6 tok/s

已测试机器(GPU/APU)

该引擎不绑定于特定参考显卡。NVIDIA架构通过CMake选择;HIP构建应针对设备的确切gfx架构。

架构硬件运行时详情
RDNA4 gfx1201Radeon AI PRO R9700ROCm 7.2Qwen 3.8 R9700快速开始
RDNA3.5 gfx1151Ryzen AI MAX+ 395 / Strix HaloROCm 7.2DeepSeek V4 Strix配置文件
RDNA3 gfx1100Radeon RX 7900 XT / XTXROCm 6+DeepSeek V4双AMD配置文件
Ampere sm_86RTX 3090CUDA 12+https://github.com/Luce-Org/lucebox/pull/637 和 Megakernel结果
Blackwell sm_120RTX 5090CUDA 12.8+https://github.com/Luce-Org/lucebox/pull/637
Blackwell sm_121DGX Spark / GB10CUDA 12.9Qwen 3.5 NVFP4结果
Ada sm_89RTX 4090CUDA 12+Linux 和 WSL2 社区测试
Turing sm_75RTX 2080 TiCUDA 12.0DFlash结果
Volta sm_70、Pascal sm_61V100、P40CUDA 12.0CUDA快速开始
未图示Blackwell sm_110Jetson AGX ThorCUDA 13.0Thor快速开始

单设备结果

硬件模型测试结果
R9700https://huggingface.co/unsloth/Qwen3.8-27B-GGUF/blob/main/Qwen3.8-27B-UD-IQ4_XS.gguf + https://huggingface.co/incoai/Qwen3.8-27B-DFlash2/blob/main/model.safetensorsHumanEval平均208.1 tok/s;最佳请求227.8 tok/s
Strix Halohttps://huggingface.co/Lucebox/DeepSeek-V4-Flash-0731-ROCmFP3/blob/main/DeepSeek-V4-Flash-0731-ROCMFPX-MIX-STRIX.gguf + https://huggingface.co/Lucebox/DeepSeek-V4-Flash-0731-DSpark-GGUF/blob/main/DeepSeek-V4-Flash-0731-DSpark-draft-Q4RMFP4-denseF16.gguf高接受度中位数32.7 tok/s;固定30条提示评估平均27.9 tok/s(使用全部6个路由专家)
RTX 5090Qwen 3.8 27B26,758token提示+1,024token续写场景下110.6 tok/s(https://github.com/Luce-Org/lucebox/pull/637)

异构和并行结果

硬件配置实测结果
2x RTX 3090 + NVLinkQwen 3.8 目标张量并行 + DFlash279.7 tok/s,自回归解码提速 2.16×(https://github.com/Luce-Org/lucebox/pull/637)
RX 7900 XT + Strix HaloDeepSeek V4 启用全部六个专家 + DSpark 验证宽度 4解码速度 45.0 至 47.7 tok/s;132,981 tokens 预填充速度 111.2 tok/s(https://github.com/Luce-Org/lucebox/pull/604#qualified-results)
R9700 + Strix HaloDeepSeek V4 跨双 AMD 设备解码速度 86 tok/s;2K tokens 预填充速度 788 tok/s

这些运行使用不同的提示词、量化方式和推理策略。它们展示了哪些配置有效,而非跨硬件性能排名。

推荐配置

有关模型和硬件矩阵(包括单GPU和混合GPU配置文件),请参见推荐服务器配置。

客户端测试工具

harness/ 通过主流编码客户端运行 Lucebox 并检查服务器兼容性。

客户端启动器
Claude Coderun_claude_code.sh
Codexrun_codex.sh
OpenCoderun_opencode.sh
Hermesrun_hermes.sh
Pirun_pi.sh
OpenClawrun_openclaw.sh
Open WebUIrun_openwebui.sh

设置服务器二进制文件和模型路径,然后运行启动器:

DFLASH_SERVER_BIN=server/build/dflash_server \
DFLASH_TARGET=server/models/Qwen3.8-27B-UD-IQ4_XS.gguf \
DFLASH_DRAFT=server/models/draft/qwen38-dflash2-q8_0.gguf \
MAX_CTX=32768 \
harness/clients/run_codex.sh

有关设置、无草稿目标和基准测试,请参见测试工具指南。

使用 Docker 快速启动

GHCR 上的预构建镜像跟踪 main 分支。挂载权重并在 :8000 上提供 OpenAI 兼容 API。

GPU镜像标签
NVIDIA (CUDA 12+):cuda12
AMD (ROCm 6+):rocm

将目标模型放入 server/models/,并将匹配的草稿模型放入 server/models/draft/。

运行适用于您 GPU 的镜像:

# NVIDIA
docker run --rm --gpus all -p 8000:8080 \
-v "$PWD/server/models:/opt/lucebox-hub/server/models" \
ghcr.io/luce-org/lucebox-hub:cuda12

# AMD
docker run --rm --device /dev/kfd --device /dev/dri \
--group-add video --group-add render --security-opt seccomp=unconfined \
-p 8000:8080 -v "$PWD/server/models:/opt/lucebox-hub/server/models" \
ghcr.io/luce-org/lucebox-hub:rocm

运行服务器

本快速启动运行上述 R9700 配置文件。完整的参数参考见服务器指南。

# 构建(ROCm 7.2+,RDNA4)
git clone --recurse-submodules https://github.com/Luce-Org/lucebox.git
cd lucebox
cmake -S server -B server/build-hip -G Ninja \
-DCMAKE_BUILD_TYPE=Release \
-DCMAKE_HIP_COMPILER=/opt/rocm/lib/llvm/bin/clang++ \
-DDFLASH27B_GPU_BACKEND=hip \
-DDFLASH27B_HIP_ARCHITECTURES=gfx1201 \
-DGGML_HIP_MMQ_MFMA=ON \
-DGGML_HIP_NO_VMM=ON
cmake --build server/build-hip --target dflash_server -j"$(nproc)"

# 目标模型和 DFlash2 草稿模型
mkdir -p models
huggingface-cli download unsloth/Qwen3.8-27B-GGUF \
Qwen3.8-27B-UD-IQ4_XS.gguf --local-dir models
huggingface-cli download incoai/Qwen3.8-27B-DFlash2 --local-dir models/dflash2
python server/scripts/convert_dflash_to_gguf.py \
models/dflash2/model.safetensors models/qwen38-dflash2-f16.gguf
python server/scripts/quantize_dflash_draft.py \
models/qwen38-dflash2-f16.gguf models/qwen38-dflash2-q8_0.gguf --scheme q8_0

# 启动实测配置文件
./server/build-hip/dflash_server models/Qwen3.8-27B-UD-IQ4_XS.gguf \
--draft models/qwen38-dflash2-q8_0.gguf \
--draft-block-size 16 --max-ctx 131072 \
--cache-type-k q8_0 --cache-type-v q8_0 \
--port 8216

curl -s http://127.0.0.1:8216/v1/chat/completions \
-H 'Content-Type: application/json' \
-d '{"messages":[{"role":"user","content":"Write a Python LRU cache."}],
"max_tokens":256,"temperature":0}'

文档

主题指南
推荐的模型和硬件配置文件推荐配置
运行时参数服务器参数参考
OpenAI 聊天补全、响应和 Anthropic 消息API 参考
CUDA、HIP 和混合设备部署混合后端指南
DeepSeek V4 单设备和异构配置文件DeepSeek V4 指南
环境变量环境变量参考
服务器内部原理架构
客户端集成和验证测试工具指南

基准测试随各实现一同发布:DFlash、PFlash、Spark、KVFlash 和 Megakernel。


教程

各优化和测试工具设置的视频教程。

Luce KVFlash ▶ ***

Lucebox 机器

本地 AI 应该是默认选择,而非特权。私有数据、无按 token 计费、无供应商锁定。Lucebox 将 R9700 与 Strix Halo 配对,提供这款开箱即用的开源引擎。

有关硬件和当前基准测试,请访问 lucebo***。


贡献请求

我们欢迎针对 CUDA 和 HIP 内核、推测性推理、更多消费级 GPU 和 APU 支持、性能基准测试以及客户端测试工具的重点贡献。


引用

@software{lucebox_2026,
title = {Lucebox: Speculative inference for heterogeneous consumer hardware},
author = {Lucebox},
url = {https://github.com/Luce-Org/lucebox},
year = {2026}
}

社区

  • *****:*.gg/yHfswqZmJQ
  • 网站:lucebo***
  • 问题反馈:https://github.com/Luce-Org/lucebox/issues
  • 博客:lucebo***/blog

Apache 2.0 · Lucebo***

轩辕镜像配置手册

按平台快速找到配置文档

一键安装

一键安装 Docker

Linux Docker 一键安装

AI

用 AI 使用轩辕镜像

agents.md · AI 对话 · 提示词

Docker

登录仓库拉取

登录认证 · 私有仓库

专属域名拉取

免登录 · 高速拉取

Linux

Docker 镜像配置

Windows / Mac

Docker Desktop 配置

MacOS OrbStack

OrbStack 容器

Apple Container

macOS 原生容器

Docker Compose

Compose 项目配置

NAS

群晖

Synology 配置

飞牛

fnOS 镜像配置

绿联

绿联 NAS

威联通

QNAP 配置

极空间

极空间 NAS

Unraid

Unraid NAS

企业仓库

其他仓库

ghcr · Quay · nvcr

Harbor 镜像源

Proxy Repository 对接

Portainer 镜像源

Registries 配置

Nexus 镜像源

Docker Proxy 缓存

开发工具

Dev Containers

VS Code 开发容器

Podman

Podman 配置指南

Singularity / Apptainer

HPC 科学计算容器

Kubernetes

K8s Containerd

Kubernetes · Containerd

K3s

轻量级集群

面板 / 网络

爱快路由

爱快 4.0 · iKuai 镜像加速

宝塔面板

一键配置镜像源

需要其他帮助?请查看我们的 常见问题Docker 镜像访问常见问题解答 或 提交工单

镜像拉取常见问题

功能

版本功能对比

功能对比 · 版本选择

支持的镜像仓库

Docker Hub · GCR · GHCR

专属域名用法

专属域名 · 开启停用 · 多仓库

新手拉取配置

登录 · 专属域名 · 配置

docker search 限制

专属域名 · Hub 搜索

不支持 push

仅支持 pull · 不支持

拉取速度原因

带宽 · 缓存 · 冷热镜像

错误码

402 与流量用尽

402 · 流量包 · 充值

401 认证失败

401 · docker login

manifest unknown

标签错误 · 镜像不存在

410 Gone 排查

410 · Docker 升级

429 限流

免费版 · 专业版 · 企业版 · 请求频率

其他报错

DNS 超时

DNS 解析 · 网络超时

TLS 证书失败

no matching manifest(架构)

docker.sock / daemon

账号

失败是否计费

manifest · blob · 计费

申请开票(企业 / 个人)

开票 · 发票 · 工单

修改登录密码

网站 · 仓库 · 重置

注销账户

工单 · 数据 · 注销

原理

mirrors 不生效

daemon.json · 重启

去掉域名前缀

docker tag · 重命名

指定架构拉取

ARM64 · AMD64 · 多架构

latest 与「最新」

digest · 版本号 · 标签

查看全部问题→

用户好评

来自真实用户的反馈,见证轩辕镜像的优质服务

用户头像

oldzhang

运维工程师

Linux服务器

5

"Docker访问体验非常流畅,大镜像也能快速完成下载。"

轩辕镜像
镜像详情
...
ghcr.io/luce-org/lucebox-hub
定价查看流量套餐与价格
博客Docker 镜像公告与技术博客
专业版 · 高速稳定拉取镜像
高速镜像下载·在线技术支持·99.95% SLA 保障·付费会员免广告
50GB 仅 ¥8/年
专业版 · 高速稳定拉取镜像
50GB 仅 ¥8/年
高速镜像下载·在线技术支持·99.95% SLA 保障·付费会员免广告
用户协议·隐私政策·增值电信业务经营许可证:浙B2-20261007·©2024-2026 源码跳动©2024-2026 杭州源码跳动科技有限公司·商务合作:点击复制邮箱