核心问题: KTransformers 能否在你的 CPU 与 GPU 显存预算内运行你关注的模型,而无需部署完整的多卡环境?
RepoDaily 采用评分
RepoDaily 将该项目的采用分评为 89/100(强):分数来自文章来源、安装路径、生产风险、差异化、许可证清晰度以及 AI/Agent 适配度。
包含 5 个来源、覆盖 5 类来源;如有 RepoDaily 独有模块,会进一步提高证据分。
检测到 5 个工作流步骤、5 个下一步动作,以及 1 个命令/安装信号。
趋势热度为 +328 stars;如内容中有 release、issue 或维护信号,会提高维护可信度。
采纳风险标记为 medium,并包含 4 条安全说明与 4 条跳过条件。
3 个机会视角、4 个替代方案,以及 4 个类型化模块支撑差异化判断。
文章中包含许可证来源或许可证表述。
文章正文和元数据中检测到 6 个 AI/Agent 相关信号。
项目概览
KTransformers 是 kvcache-ai 团队的开源研究项目,瞄准一个非常具体的痛点:在单张 GPU 上无法完整加载的超大语言模型如何运行和微调。它不依赖 8 卡服务器,而是将模型拆分到 CPU 与 GPU,计算密集层放在 GPU,其余部分卸载到系统内存。README 将其描述为「通过 CPU-GPU 异构计算实现大语言模型高效推理与微调的研究项目」。
项目从 kt-kernel 源码树暴露两项面向用户的能力:推理与有监督微调(SFT)。推理文档位于 kt-kernel/README.md,微调则通过独立的快速入门指南提供,并与 LLaMA-Factory 集成。这种「推理 + 微调」一体化的异构执行路径,是 KTransformers 区别于纯推理引擎的关键。
版本节奏完全由模型驱动。2025 年 7 月到 2026 年 6 月间,项目为 Kimi-K2、Kimi-K2-Thinking、MiniMax-M2.1、MiniMax-M2.5、GLM-5、GLM-5.2、DeepSeek-V4-Flash、MiniMax-M3 和 Kimi-K2.5 提供了 Day0 或接近 Day0 的支持。这个节奏说明项目与前沿模型发布周期紧密绑定,而非走稳定的平台版本路线。
硬件覆盖也超出了 x86 CPU 和 NVIDIA GPU。更新日志记录了对 Intel Arc GPU(2025 年 5 月)、昇腾 NPU(2025 年 10 月)、仅 AVX2 的 CPU 后端(2026 年 3 月)、AMX-Int8 与 AMX-BF16 指令(2025 年 4 月)以及原生 BF16 与 FP8 per-channel 精度(2026 年 1 月)的支持。硬件广度直接决定了哪些机器能承载大模型。
为什么现在变热
- 2026 年 6 月 21 日 Day0 支持 MiniMax-M3,6 月 17 日 Day0 支持 GLM-5.2 —— 二者均为 2026 年中讨论度最高的开源权重模型。
- 2026 年 5 月 2 日支持 DeepSeek-V4-Flash,为在异构硬件上运行重要推理模型提供路径。
- v0.6.1(2026 年 4 月 30 日)将推理与 SFT 入口拆分,使两条工作流更易被独立发现。
- 2026 年 1 月上线 CPU-GPU 专家调度与原生 BF16/FP8 精度,直接提升 MoE 模型吞吐。
- 项目在 GOSIM Paris 2026 的「Agentic AI on Edge」分会场展示,聚焦消费级硬件上的推理性能。
解决什么问题
- DeepSeek-V4、Kimi-K2.5、MiniMax-M3 等前沿 MoE 模型动辄数千亿参数,多数个人开发者无法在 GPU 上完整加载。
- 多卡集群昂贵且稀缺,而一台带单卡 GPU 和充足系统内存的工作站要容易获得得多。
- 传统上大模型微调需要与推理不同的基础设施,硬件成本翻倍。
- 新开源权重模型的发布速度远快于多数推理框架的适配速度,用户常常需要等待数周。
工作原理
- 框架加载受支持模型并按可用算力分区:延迟敏感层放 GPU,其余放 CPU(可选磁盘)。
- 对 MoE 模型,CPU-GPU 专家调度将专家层路由到 CPU 指令集(AVX2、AMX)与 GPU 核心以最大化利用率。
- 推理通过 kt-kernel 路径提供服务,README 将其与微调文档分开。
- 微调方面,KTransformers 与 LLaMA-Factory 集成,2025 年 12 月 22 日新增 RL-DPO 支持。
- 三层 GPU-CPU-Disk prefix cache(2025 年 6 月)在请求间复用已计算的 KV 状态,减少重复计算。
产品演示与界面预览

架构解读:异构拆分如何工作
KTransformers 并不靠压缩或量化把模型塞进单卡 GPU,而是把 CPU 内存当作一等公民。README 写明项目聚焦「CPU-GPU 异构计算」,更新日志显示了具体机制:面向 MoE 的 CPU-GPU 专家调度(2026 年 1 月 22 日)、AMX-Int8 与 AMX-BF16 指令支持(2025 年 4 月 29 日)、仅 AVX2 的 CPU 后端(2026 年 3 月 26 日)以及原生 BF16 与 FP8 per-channel 精度(2026 年 1 月 22 日)。
2025 年 6 月 30 日加入的三层 prefix cache 跨越 GPU、CPU 和磁盘,意味着即使已计算的前缀超出显存也能留存。这对长上下文 Agent 工作负载尤其相关,因为相同的系统提示会在多次调用中重复出现。
微调侧通过 LLaMA-Factory 集成运行(2025 年 11 月 4 日),随后增加 RL-DPO(2025 年 12 月 22 日)。支撑推理的同一套异构执行引擎也支撑训练循环,这正是单机能同时服务和适配模型的原因。
集成面:受支持模型与硬件
- Day0 或原生支持的模型包括 MiniMax-M3、GLM-5.2、DeepSeek-V4-Flash、Kimi-K2.5、Kimi-K2-Thinking、MiniMax-M2.5、MiniMax-M2.1、GLM-5、Qwen3-Next、Kimi-K2-0905、SmallThinker、GLM4-MoE。
- CPU 后端:仅 AVX2(2026 年 3 月)、AMX-Int8、AMX-BF16(2025 年 4 月)。
- NVIDIA 之外的加速器:Intel Arc GPU(2025 年 5 月)、昇腾 NPU(2025 年 10 月)。
- 精度模式:原生 BF16 与 FP8 per-channel(2026 年 1 月)。
- 外部集成:2025 年 10 月 10 日 KTransformers 已集成进 SGLang,路线图发布在 sgl-project/sglang issue 跟踪器,lmsys.org 上有配套博客。
- 微调:LLaMA-Factory 集成(2025 年 11 月)含 RL-DPO(2025 年 12 月)以及 AutoDL 训推一体(2026 年 1 月)。
上手路径:从哪里开始
- 推理入口:仓库内 kt-kernel/README.md。
- SFT 入口:doc/en/SFT/KTransformers-Fine-Tuning_Quick-Start.md。
- 模型专属教程链接位于 README 更新栏目,例如 doc/en/kt-kernel/MiniMax-M3-Tutorial.md 与 doc/en/kt-kernel/GLM-5.2-Tutorial.md。
- pyproject.toml 声明需要 Python >= 3.11。
- pyproject.toml 的分类器列出「Operating System :: POSIX :: Linux」,官方发行面向 Linux。
维护风险:需要留意什么
KTransformers 的节奏由前沿模型发布驱动。2025 年 7 月到 2026 年 6 月间,README 记录了超过十五次重要更新,大约每三周一次。对想用最新模型的用户是优点,但也意味着教程、API 和默认配置经常变化。
项目在 README 中自称「研究项目」,并非生产级平台。2026 年 4 月的 v0.6.1 将推理与 SFT 文档拆分为独立入口,这有助于发现,但也说明表面区域仍在重塑。
pyproject.toml 分类器中仅列出 Linux。macOS 或 Windows 用户应预期需要 Linux 机器或精心配置的 WSL2。
谁适合关注
适合关注
- 你想在一张 GPU 加充足系统内存的工作站上运行 DeepSeek-V4-Flash、Kimi-K2.5、MiniMax-M3 或 GLM-5.2。
- 你想用 LLaMA-Factory 或 RL-DPO 微调大型 MoE 模型,但不想租多卡集群。
- 你有 Intel Arc 或昇腾 NPU 硬件,想找非 NVIDIA 推理栈。
- 你在研究面向 MoE 专家层的 CPU-GPU 调度策略。
可以先跳过
- 你需要稳定的、生产级服务 API 和长期向后兼容保证。
- 你在 Windows 或 macOS 上运行,且没有 Linux 环境。
- 你的模型已经完全装入显存,不需要 CPU 卸载。
- 你需要模型专属教程之外的系统化参考文档。
风险与注意事项
项目活跃且能力扎实,但属于研究级别:频繁的模型驱动发布、官方仅支持 Linux、文档以模型教程为主而非稳定参考。
- README 明确将 KTransformers 称为「研究项目」,而非生产系统。
- pyproject.toml 仅声明 POSIX :: Linux 支持,没有 Windows 或 macOS 分类器。
- 更新频率(12 个月内 15 次以上重要条目)意味着配置和推荐路径经常变化。
- 多数文档以模型教程形式组织,而非统一的 API 参考。
- Day0 模型支持依赖项目跟上前沿发布节奏,对小众架构可能滞后。
- Apache License 2.0 允许商业使用、修改和再分发,义务有限。
- 项目会从任意来源加载外部模型权重,用户在推理或微调前应核验 checkpoint 来源。
- README 未文档化任何鉴权或访问控制层 —— 对外暴露的推理端点应视为未鉴权。
- GPU-CPU-Disk prefix cache 会将已计算状态写入磁盘;对敏感提示词应考虑磁盘加密。
替代方案比较
| 方案 | 适用场景 | 代价 |
|---|---|---|
vLLM | 模型可完全装入可用显存,且你需要成熟的生产级推理服务器。 | 免费,开源(Apache 2.0)。 |
llama.cpp | 你需要最大的 CPU 灵活性与更广的平台覆盖,包括 macOS 和 Windows。 | 免费,开源(MIT)。 |
SGLang | 你需要高吞吐推理引擎 —— 值得注意的是 KTransformers 已于 2025 年 10 月集成进 SGLang。 | 免费,开源(Apache 2.0)。 |
LLaMA-Factory(独立使用) | 你想要微调能力,但不需要 KTransformers 额外提供的异构 CPU-GPU 执行层。 | 免费,开源。 |
这个趋势说明了什么
单工作站微调服务
由于 KTransformers 通过 LLaMA-Factory 将 SFT 与异构推理耦合,小团队可以在租用的单卡机器上按需微调千亿模型,而非依赖专用集群。
在单个目标模型上跑通 SFT 快速入门(doc/en/SFT/KTransformers-Fine-Tuning_Quick-Start.md),测量耗时与 CPU/GPU 峰值内存。
边缘 Agent 推理
GOSIM Paris 2026 的「Agentic AI on Edge」演讲揭示项目朝消费级硬件方向走。维护长共享系统提示的 Agent 能从三层 prefix cache 中获益。
在开启与关闭 GPU-CPU-Disk prefix cache 的情况下,分别压测多轮 Agent 工作负载,比较缓存命中率与延迟差。
非 NVIDIA 加速器支持
已有 Intel Arc(2025 年 5 月)与昇腾 NPU(2025 年 10 月)支持,KTransformers 是少数面向前沿 MoE 模型、覆盖非 NVIDIA 异构设置的框架之一。
在每种加速器上跑同一个受支持模型,用同一 checkpoint 对比 NVIDIA 基线的吞吐。
RepoDaily 判断
KTransformers 解决了一个真实且日益紧迫的问题 —— 在非多卡集群的机器上运行和微调前沿 MoE 模型。模型覆盖确实令人印象深刻,对 2026 年主要发布都有 Day0 支持。代价是它仍是研究项目,表面变动快、官方仅打包 Linux、文档以教程而非参考为主。先用一个具体模型跑通,再决定是否标准化。