Aadeshveer's Blog

The llama journey

Day 1

12 December 2025 (~2 hr)

Today's Target: Build it myself


Day 2

13 December 2025 (30 mins)

Today's Target: Try to understand maybe simple example

TODO:


Day 3

14 December 2025 (1.5 hrs)

Today's Target: Finish understanding simple.cpp

TODO:


Day 4

16 December 2025 (2.5 hrs)

Today's Target: Look into simple-chat.cpp and argmax.cu

TODO:


Day 5

19 December 2025 (1 hrs)

TODO:


Day 6

20 December 2025 (1 hrs)

TODO:


Day 7

21 December 2025 (1 hrs)

Today's Target: Start fighting with matmul

TODO: mul_mat_f_cuda function


Day 8

22 December 2025 (30 mins)


Day 9

23 December 2025(1 hr)


Day 10

24 December 2025 (5hrs)

Target: I am too saturated to go behind matmul right now and saw potential of improvement in cumsum hence I shall be going full on to it to improve performance on llm arch like mamba/qwen3


Day 11

28 December 2025 (2.5 hrs)

Target: I am thinking of learning more about warp level primitives from nvidia dev blog and then potentially getting a good optimization on the ssm kernals as they seem to be quite naive implementations


Day 12

29 Decmeber 2025 (3 hrs)


Day 13

30 December 2025 (4 hrs)


Day 14

31 December 2025(5 hrs)