ARTICLE DETAIL

资讯详情

深耕编程入门与网站建设的一线实战洞察。

手把手手写反向传播直到 GPT:Neural Networks Zero to Hero 完整指南

手把手手写反向传播直到 GPT:Neural Networks Zero to Hero 完整指南 手把手手写反向传播直到 GPTNeural Networks Zero to Hero 完整指南【免费下载链接】nn-zero-to-heroNeural Networks: Zero to Hero项目地址: https://gitcode.com/GitHub_Trending/nn/nn-zero-to-heroNeural Networks: Zero to Hero 是一套手写神经网络的课程笔记本micrograd 线逐行搭出标量自动求导引擎makemore 线从 bigrams 语言模型一路加到 BatchNorm 和 CNN。全仓 7 个 notebook都把推导过程写成了可运行的代码给那些说不清反向传播到底在算什么的新手以及没用过手写 autograd 的 PyTorch 用户。 你卡在哪loss.backward() 的黑盒问题你有没有过这种体验视频看时觉得懂了一动手就卡住——梯度到底从哪来为什么不加 BatchNorm 训练就会炸这门课的处理方式很直接不给你现成结论把每一步推导写进 notebook。课程索引和每讲的前置要求都写在 README.md 里。 micrograd 两个 notebook 怎么跑通lectures/micrograd/ 下两个 notebook对应第一讲的前后半场先手搓标量自动求导引擎、手写链式法则再拿这个引擎搭网络、跑一轮训练。过关标准不翻笔记本自己出个三行的计算图几个 mul/add 加一个 tanh能手算出损失对输入的梯度。能做到就进下一阶段做不到停在这里重做。前置要求是 Python 基础加一点高中微积分链式法则模糊的话先复习导数否则看得很吃力。 makemore part1 到 part3 怎么逐层加料lectures/makemore/ 下 5 个 notebook 按 part1 到 part5 排开开跑前需补一点 torch.Tensor 基础part1 makemore_part1_bigrams.ipynb字符级 bigram 语言模型覆盖训练、采样、loss 三件套负对数似然。part2升级成 MLP学习率、train/dev/test 划分、过拟合等概念在这引入。part3看前向激活与反向梯度的统计学用 BatchNorm 治训练不稳。过关标准用自己的话说清 BatchNorm 解决了什么问题、不加会出现什么症状。说不清回 part3 的可视化部分再看一遍。part4 手写反向传播与 part5 CNN 怎么做GPT 笔记本在哪part4 是最难的一节把 part3 的两层 MLP BatchNorm 拿过来不用 loss.backward()从交叉熵、线性层、tanh、BatchNorm 一路手推回 embedding 表。作者建议先自己推卡住了暂停视频看答案——只看不写收获会缩水一大截。part5 把 MLP 加深成类 WaveNet 的卷积结构torch.nn 用法密度高每步打印一下 shape查文档别猜。顺带提醒第 7 讲从零搭 GPT和第 8 讲GPT 分词器目前只有视频仓库里还没有对应 notebook别去 lectures 里找这两个文件。今晚就开工跑git clone https://gitcode.com/GitHub_Trending/nn/nn-zero-to-hero打开 micrograd 上半场的第一个 notebook把第一个梯度手算出来——这是拿到入场券的第一步。【免费下载链接】nn-zero-to-heroNeural Networks: Zero to Hero项目地址: https://gitcode.com/GitHub_Trending/nn/nn-zero-to-hero创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表