Key Info
A community-released local AI slide deck covers a broad set of LLM serving and efficiency topics, all explained through llama.cpp.
Highlights
- Topics include prefill vs decode and MoE vs dense architectures
- Covers VRAM vs unified memory tradeoffs for local deployment
- Explains quantization techniques
- Explains speculative decoding
- Released for reuse with attribution