核心信息

llama.cpp 可通过 ggml RPC 后端在异构设备间分发推理,实测在 RTX 6000 GPU 与 M5 笔记本之间通过 10 GbE 运行 MiMo 2.6 Flash,速度达 40 tokens/sec。

要点

  • 基于 ggml RPC 后端实现跨设备推理分发
  • 采用 SOTA 模型的原生 mxfp4 权重,在异构硬件上运行
  • llama.cpp 开箱支持该功能
  • 目前属高级设置,后续计划让普通用户更易使用