
计算图与梯度累积:为什么训练前必须清空梯度
你写了 optimizer.zero_grad() 却不知道为什么要写。这一篇把 PyTorch 的动态计算图、叶子节点和梯度累积机制讲透,让你彻底明白"清梯度"不是仪式,是物理必然。
和「计算图」相关的文章都收在这里,方便沿着同一个主题继续读下去。
同一主题下的内容,会更容易看出思路是怎么慢慢长出来的。

你写了 optimizer.zero_grad() 却不知道为什么要写。这一篇把 PyTorch 的动态计算图、叶子节点和梯度累积机制讲透,让你彻底明白"清梯度"不是仪式,是物理必然。