RepoDaily · 2026-07-20 · Learning / Curriculum

KTransformers:在单机上实现 CPU-GPU 异构的大模型推理与微调

#14 Learning / Curriculum Python +328 kvcache-ai/ktransformers 打开仓库

KTransformers 通过将计算拆分到 CPU 与 GPU,在单台工作站上运行并微调超大 MoE 与稠密模型,已 Day0 支持 DeepSeek-V4、GLM-5.2 与 MiniMax-M3。

项目类型Learning / Curriculum
最适合需要在消费级或单工作站硬件上运行或微调 1000 亿参数以上大模型,而非依赖多卡集群的开发者与研究人员。
风险等级中等 —— 面向研究的项目,发布节奏紧跟模型更新,官方仅支持 Linux。
评估时间约 1–2 天即可完成安装、加载受支持模型并跑通首次推理或 SFT。

核心问题: KTransformers 能否在你的 CPU 与 GPU 显存预算内运行你关注的模型,而无需部署完整的多卡环境?

89/100

RepoDaily 采用评分

RepoDaily 将该项目的采用分评为 89/100(强):分数来自文章来源、安装路径、生产风险、差异化、许可证清晰度以及 AI/Agent 适配度。

基于 RepoDaily 来源和采用说明的方向性评分,不是基准测试。风险: 中
100证据质量

包含 5 个来源、覆盖 5 类来源;如有 RepoDaily 独有模块,会进一步提高证据分。

92可安装/可试用性

检测到 5 个工作流步骤、5 个下一步动作,以及 1 个命令/安装信号。

62维护可信度

趋势热度为 +328 stars;如内容中有 release、issue 或维护信号,会提高维护可信度。

90生产准备度

采纳风险标记为 medium,并包含 4 条安全说明与 4 条跳过条件。

100差异化

3 个机会视角、4 个替代方案,以及 4 个类型化模块支撑差异化判断。

82许可证清晰度

文章中包含许可证来源或许可证表述。

84Agent / AI 适配度

文章正文和元数据中检测到 6 个 AI/Agent 相关信号。

项目概览

KTransformers 是 kvcache-ai 团队的开源研究项目,瞄准一个非常具体的痛点:在单张 GPU 上无法完整加载的超大语言模型如何运行和微调。它不依赖 8 卡服务器,而是将模型拆分到 CPU 与 GPU,计算密集层放在 GPU,其余部分卸载到系统内存。README 将其描述为「通过 CPU-GPU 异构计算实现大语言模型高效推理与微调的研究项目」。

项目从 kt-kernel 源码树暴露两项面向用户的能力:推理与有监督微调(SFT)。推理文档位于 kt-kernel/README.md,微调则通过独立的快速入门指南提供,并与 LLaMA-Factory 集成。这种「推理 + 微调」一体化的异构执行路径,是 KTransformers 区别于纯推理引擎的关键。

版本节奏完全由模型驱动。2025 年 7 月到 2026 年 6 月间,项目为 Kimi-K2、Kimi-K2-Thinking、MiniMax-M2.1、MiniMax-M2.5、GLM-5、GLM-5.2、DeepSeek-V4-Flash、MiniMax-M3 和 Kimi-K2.5 提供了 Day0 或接近 Day0 的支持。这个节奏说明项目与前沿模型发布周期紧密绑定,而非走稳定的平台版本路线。

硬件覆盖也超出了 x86 CPU 和 NVIDIA GPU。更新日志记录了对 Intel Arc GPU(2025 年 5 月)、昇腾 NPU(2025 年 10 月)、仅 AVX2 的 CPU 后端(2026 年 3 月)、AMX-Int8 与 AMX-BF16 指令(2025 年 4 月)以及原生 BF16 与 FP8 per-channel 精度(2026 年 1 月)的支持。硬件广度直接决定了哪些机器能承载大模型。

解决什么问题

  • DeepSeek-V4、Kimi-K2.5、MiniMax-M3 等前沿 MoE 模型动辄数千亿参数,多数个人开发者无法在 GPU 上完整加载。
  • 多卡集群昂贵且稀缺,而一台带单卡 GPU 和充足系统内存的工作站要容易获得得多。
  • 传统上大模型微调需要与推理不同的基础设施,硬件成本翻倍。
  • 新开源权重模型的发布速度远快于多数推理框架的适配速度,用户常常需要等待数周。

工作原理

  1. 框架加载受支持模型并按可用算力分区:延迟敏感层放 GPU,其余放 CPU(可选磁盘)。
  2. 对 MoE 模型,CPU-GPU 专家调度将专家层路由到 CPU 指令集(AVX2、AMX)与 GPU 核心以最大化利用率。
  3. 推理通过 kt-kernel 路径提供服务,README 将其与微调文档分开。
  4. 微调方面,KTransformers 与 LLaMA-Factory 集成,2025 年 12 月 22 日新增 RL-DPO 支持。
  5. 三层 GPU-CPU-Disk prefix cache(2025 年 6 月)在请求间复用已计算的 KV 状态,减少重复计算。

产品演示与界面预览

KTransformers SFT
KTransformers SFT 工作流 — README 官方配图,展示 KTransformers 的有监督微调界面,帮助读者理解 SFT 如何与推理并列呈现。 README.md image

架构解读:异构拆分如何工作

KTransformers 并不靠压缩或量化把模型塞进单卡 GPU,而是把 CPU 内存当作一等公民。README 写明项目聚焦「CPU-GPU 异构计算」,更新日志显示了具体机制:面向 MoE 的 CPU-GPU 专家调度(2026 年 1 月 22 日)、AMX-Int8 与 AMX-BF16 指令支持(2025 年 4 月 29 日)、仅 AVX2 的 CPU 后端(2026 年 3 月 26 日)以及原生 BF16 与 FP8 per-channel 精度(2026 年 1 月 22 日)。

2025 年 6 月 30 日加入的三层 prefix cache 跨越 GPU、CPU 和磁盘,意味着即使已计算的前缀超出显存也能留存。这对长上下文 Agent 工作负载尤其相关,因为相同的系统提示会在多次调用中重复出现。

微调侧通过 LLaMA-Factory 集成运行(2025 年 11 月 4 日),随后增加 RL-DPO(2025 年 12 月 22 日)。支撑推理的同一套异构执行引擎也支撑训练循环,这正是单机能同时服务和适配模型的原因。

集成面:受支持模型与硬件

  • Day0 或原生支持的模型包括 MiniMax-M3、GLM-5.2、DeepSeek-V4-Flash、Kimi-K2.5、Kimi-K2-Thinking、MiniMax-M2.5、MiniMax-M2.1、GLM-5、Qwen3-Next、Kimi-K2-0905、SmallThinker、GLM4-MoE。
  • CPU 后端:仅 AVX2(2026 年 3 月)、AMX-Int8、AMX-BF16(2025 年 4 月)。
  • NVIDIA 之外的加速器:Intel Arc GPU(2025 年 5 月)、昇腾 NPU(2025 年 10 月)。
  • 精度模式:原生 BF16 与 FP8 per-channel(2026 年 1 月)。
  • 外部集成:2025 年 10 月 10 日 KTransformers 已集成进 SGLang,路线图发布在 sgl-project/sglang issue 跟踪器,lmsys.org 上有配套博客。
  • 微调:LLaMA-Factory 集成(2025 年 11 月)含 RL-DPO(2025 年 12 月)以及 AutoDL 训推一体(2026 年 1 月)。

上手路径:从哪里开始

  • 推理入口:仓库内 kt-kernel/README.md。
  • SFT 入口:doc/en/SFT/KTransformers-Fine-Tuning_Quick-Start.md。
  • 模型专属教程链接位于 README 更新栏目,例如 doc/en/kt-kernel/MiniMax-M3-Tutorial.md 与 doc/en/kt-kernel/GLM-5.2-Tutorial.md。
  • pyproject.toml 声明需要 Python >= 3.11。
  • pyproject.toml 的分类器列出「Operating System :: POSIX :: Linux」,官方发行面向 Linux。

维护风险:需要留意什么

KTransformers 的节奏由前沿模型发布驱动。2025 年 7 月到 2026 年 6 月间,README 记录了超过十五次重要更新,大约每三周一次。对想用最新模型的用户是优点,但也意味着教程、API 和默认配置经常变化。

项目在 README 中自称「研究项目」,并非生产级平台。2026 年 4 月的 v0.6.1 将推理与 SFT 文档拆分为独立入口,这有助于发现,但也说明表面区域仍在重塑。

pyproject.toml 分类器中仅列出 Linux。macOS 或 Windows 用户应预期需要 Linux 机器或精心配置的 WSL2。

谁适合关注

适合关注

  • 你想在一张 GPU 加充足系统内存的工作站上运行 DeepSeek-V4-Flash、Kimi-K2.5、MiniMax-M3 或 GLM-5.2。
  • 你想用 LLaMA-Factory 或 RL-DPO 微调大型 MoE 模型,但不想租多卡集群。
  • 你有 Intel Arc 或昇腾 NPU 硬件,想找非 NVIDIA 推理栈。
  • 你在研究面向 MoE 专家层的 CPU-GPU 调度策略。

可以先跳过

  • 你需要稳定的、生产级服务 API 和长期向后兼容保证。
  • 你在 Windows 或 macOS 上运行,且没有 Linux 环境。
  • 你的模型已经完全装入显存,不需要 CPU 卸载。
  • 你需要模型专属教程之外的系统化参考文档。

风险与注意事项

项目活跃且能力扎实,但属于研究级别:频繁的模型驱动发布、官方仅支持 Linux、文档以模型教程为主而非稳定参考。

  • README 明确将 KTransformers 称为「研究项目」,而非生产系统。
  • pyproject.toml 仅声明 POSIX :: Linux 支持,没有 Windows 或 macOS 分类器。
  • 更新频率(12 个月内 15 次以上重要条目)意味着配置和推荐路径经常变化。
  • 多数文档以模型教程形式组织,而非统一的 API 参考。
  • Day0 模型支持依赖项目跟上前沿发布节奏,对小众架构可能滞后。
  • Apache License 2.0 允许商业使用、修改和再分发,义务有限。
  • 项目会从任意来源加载外部模型权重,用户在推理或微调前应核验 checkpoint 来源。
  • README 未文档化任何鉴权或访问控制层 —— 对外暴露的推理端点应视为未鉴权。
  • GPU-CPU-Disk prefix cache 会将已计算状态写入磁盘;对敏感提示词应考虑磁盘加密。

替代方案比较

方案适用场景代价
vLLM
模型可完全装入可用显存,且你需要成熟的生产级推理服务器。免费,开源(Apache 2.0)。
llama.cpp
你需要最大的 CPU 灵活性与更广的平台覆盖,包括 macOS 和 Windows。免费,开源(MIT)。
SGLang
你需要高吞吐推理引擎 —— 值得注意的是 KTransformers 已于 2025 年 10 月集成进 SGLang。免费,开源(Apache 2.0)。
LLaMA-Factory(独立使用)
你想要微调能力,但不需要 KTransformers 额外提供的异构 CPU-GPU 执行层。免费,开源。

这个趋势说明了什么

单工作站微调服务

由于 KTransformers 通过 LLaMA-Factory 将 SFT 与异构推理耦合,小团队可以在租用的单卡机器上按需微调千亿模型,而非依赖专用集群。

在单个目标模型上跑通 SFT 快速入门(doc/en/SFT/KTransformers-Fine-Tuning_Quick-Start.md),测量耗时与 CPU/GPU 峰值内存。

边缘 Agent 推理

GOSIM Paris 2026 的「Agentic AI on Edge」演讲揭示项目朝消费级硬件方向走。维护长共享系统提示的 Agent 能从三层 prefix cache 中获益。

在开启与关闭 GPU-CPU-Disk prefix cache 的情况下,分别压测多轮 Agent 工作负载,比较缓存命中率与延迟差。

非 NVIDIA 加速器支持

已有 Intel Arc(2025 年 5 月)与昇腾 NPU(2025 年 10 月)支持,KTransformers 是少数面向前沿 MoE 模型、覆盖非 NVIDIA 异构设置的框架之一。

在每种加速器上跑同一个受支持模型,用同一 checkpoint 对比 NVIDIA 基线的吞吐。

下一步建议

先用一个模型端到端跑通再决定

从受支持列表中挑选一个与你硬件匹配的模型,按 README 更新栏目的教程完成一次推理调用和一次 SFT 步骤,再评估更大范围采用。

  1. 找出符合你 CPU 内存与 GPU 显存预算、且最近被支持的模型(例如 GLM-5.2 或 MiniMax-M3)。
  2. 打开 README 更新栏目中对应的 doc/en/kt-kernel/ 教程。
  3. 按 pyproject.toml 要求在 Python >= 3.11 的 Linux 机器上安装。
  4. 跑一次推理查询,对照原始模型卡核验输出质量。
  5. 按 SFT 快速入门完成一次微调步骤并记录内存占用。

RepoDaily 判断

KTransformers 解决了一个真实且日益紧迫的问题 —— 在非多卡集群的机器上运行和微调前沿 MoE 模型。模型覆盖确实令人印象深刻,对 2026 年主要发布都有 Day0 支持。代价是它仍是研究项目,表面变动快、官方仅打包 Linux、文档以教程而非参考为主。先用一个具体模型跑通,再决定是否标准化。

信息来源