BREAKING
llm.c trains GPT-2 in pure C/CUDA
0%
faster vs PyTorch
0M
GPT-2 params
Minimalist vs full framework
llm.cpure C/CUDA
No PyTorch or cPython
Kernel-level optimization
Training focused
PyTorch3.3M lines
11,000+ files
Mature ecosystem
General purpose
0min
training time
0$
cost
0x
A100 80GB
Features and known limits
1MPI + NCCL multi-node
2bfloat16 + Flash Attention
3CPU lags PyTorch
4MPI/NCCL setup hurdle
MIT-licensed, built to teach internals
AI NEWS BLITZ
Andrej Karpathy's llm.c pretrains GPT-2 using nothing but raw C and CUDA.