核心信息
llama.cpp 可通过 ggml RPC 后端在异构设备间分发推理,实测在 RTX 6000 GPU 与 M5 笔记本之间通过 10 GbE 运行 MiMo 2.6 Flash,速度达 40 tokens/sec。
要点
- 基于 ggml RPC 后端实现跨设备推理分发
- 采用 SOTA 模型的原生 mxfp4 权重,在异构硬件上运行
- llama.cpp 开箱支持该功能
- 目前属高级设置,后续计划让普通用户更易使用
llama.cpp 可通过 ggml RPC 后端在异构设备间分发推理,实测在 RTX 6000 GPU 与 M5 笔记本之间通过 10 GbE 运行 MiMo 2.6 Flash,速度达 40 tokens/sec。