Sorry, your browser cannot access this site
This page requires browser support (enable) JavaScript
Learn more >

vLLM 是怎么工作的? 本文翻译并整理自 Amit Shekhar 的 How does vLLM work?。 目录 什么是"服务一个 LLM" Prefill、Decode 与 KV cache 快速回顾 问题:KV cache 吞噬 GPU 显存 为什么朴素的服务方式会浪费内存 vLLM 是什么 PagedAttention:核心思想 PagedAttent...

从第一性原理理解分布式训练 这篇文章不打算从"DP / TP / PP / ZeRO"这些名词出发,而是反过来:先回到训练这件事的物理与数学约束,再让每一种并行策略和优化技巧"自己长出来"。 读完之后,希望你看到任何一种新的并行方案,都能立刻问出一个对的问题——它在解决哪个约束?代价是什么? 一、引子:为什么单卡装不下了? 训练一个深度学习模型,...