志浩AI模型训练记录

记录深度学习模型训练中的点滴经验 · PyTorch / TensorFlow / CUDA · 从数据集到论文复现

论文复现相关文章

复现 ResNet 论文:从原始论文到现代训练技巧

残差网络 ResNet 是深度学习史上的里程碑工作。本文从头复现了 ResNet-50/101/152 的完整训练流程,并加入了标签平滑、余弦退火等现代技巧,在 ImageNet 上取得了超越论文报告的 Top-1 准确率。

复现 Vision Transformer (ViT) 论文:从零实现图像分类

Vision Transformer 证明了纯 Transformer 架构在图像分类任务上的强大能力。本文从零实现了 ViT-B/16 模型,在 CIFAR-100 和 ImageNet-1K 上完成了完整训练,并对比了不同 Patch Size 的影响。

复现 LoRA 微调论文:高效参数微调大语言模型

LoRA (Low-Rank Adaptation) 是一种高效的参数微调方法,可以在不更新全部参数的情况下适配大语言模型到下游任务。本文复现了 LoRA 论文的核心实现,并在 LLaMA-13B 上进行了指令微调实验。