BREAKING
AirLLM runs 70B models on 4GB GPUs
One layer at a time
1Load layer
2Run compute
3Release
4Next layer
0GB
70B model
0GB
405B model
0GB
671B model
Memory bottleneck solved
FP16 70B140
AirLLM4
Reach vs speed trade-off
UpsideReach
No mandatory quantization
GPU acceleration kept
pip install airllm
DownsideSpeed
~0.2 tokens per second
I/O bound on disk
Best for offline batch jobs
Trade speed for reach
AI NEWS BLITZ
AirLLM lets massive language models run on a single 4GB consumer GPU.