大模型无疑是所有人关注的焦点,也必然是我们网络系统研究者们服务的重点对象。但很多对网络熟悉的朋友们,对于大模型复杂的软件栈是如何最后变成我们熟悉的网络通信的过程并不清楚。特撰写系列文章,回答一个问题:一行 dist.all_reduce,是怎么一层层走下去,最后变成 NVLink 上的一次显存直写、或者网卡上的一次 RDMA ibv_post_send 的。