有人整理了一份LLM工程师训练手册,每天30分钟,练10周,一共50课。不是那种拼凑的Demo,是真带你从头搭生产级技术栈:
1️⃣ 建思维模型,搞懂Decode为什么卡显存、Prefill为什么卡算力
2️⃣ 啃vLLM源码,PagedAttention和调度器逻辑一个不落
3️⃣ 上Prometheus、Grafana盯着TTFT和队列
4️⃣ 直接干1000+并发压测,FP8、INT4量化取舍讲透
学完手里有一套能跑的生产级技术栈,外加一份能拿出手的跑分报告。
🔗 https://github.com/patchy631/time-to-first-token
顺手点个star。作者还在给每个主题写长文,第一篇讲GPU到底怎么干活的,已经发了。