核心信息

一份社区开源的本地 AI 幻灯片,系统覆盖多项大模型推理与效率主题,全部结合 llama.cpp 讲解。

要点

  • 涵盖 prefill 与 decode、MoE 与稠密架构对比
  • 讲解本地部署下显存与统一内存的取舍
  • 介绍量化技术
  • 介绍推测解码
  • 允许署名后复用