Key Info

A community-released local AI slide deck covers a broad set of LLM serving and efficiency topics, all explained through llama.cpp.

Highlights

  • Topics include prefill vs decode and MoE vs dense architectures
  • Covers VRAM vs unified memory tradeoffs for local deployment
  • Explains quantization techniques
  • Explains speculative decoding
  • Released for reuse with attribution