你好,我是志浩
一名AI模型训练爱好者,专注于深度学习模型训练、数据集处理与论文复现。这里记录了我从零开始学习模型训练的全过程,包括环境配置、调试经验、性能优化以及经典论文的代码复现。希望能为同样走在AI学习路上的你提供一些参考。
最新文章
PyTorch 2.0 训练加速技巧:编译模式与算子融合实践
PyTorch 2.0 引入了 torch.compile 编译模式,可以显著提升模型训练速度。本文详细记录了我对 ResNet-50 进行编译加速的实验过程,包括算子融合策略、显存优化以及实际加速比测试结果。
大规模图像数据集清洗与预处理:从TB级原始数据到训练就绪
处理大规模图像数据集时,去重、清洗、标准化格式是必不可少的步骤。本文介绍了使用 Python 多进程和 WebDataset 格式对 TB 级数据进行高效预处理的生产级方案。
深度学习模型训练中的学习率调度策略详解
学习率是影响模型收敛效果最关键的超参数之一。本文系统对比了 Step Decay、Cosine Annealing、OneCycleLR、ReduceLROnPlateau 等常见调度策略在图像分类任务中的表现差异。
使用 NVIDIA DALI 加速数据加载与数据增强流水线
GPU 利用率上不去往往是因为 CPU 数据加载成为瓶颈。NVIDIA DALI 可以在 GPU 上执行数据增强操作,显著降低 CPU 负载。本文记录了我在 ImageNet 训练任务中集成 DALI 的完整过程。
复现 ResNet 论文:从原始论文到现代训练技巧
残差网络 ResNet 是深度学习史上的里程碑工作。本文从头复现了 ResNet-50/101/152 的完整训练流程,并加入了标签平滑、余弦退火等现代技巧,在 ImageNet 上取得了超越论文报告的 Top-1 准确率。
多卡分布式训练:PyTorch DDP 实战与踩坑记录
从单卡到多卡训练需要考虑数据并行、梯度同步、Batch Size 调整等问题。本文使用 PyTorch DistributedDataParallel (DDP) 在 4×A100 上训练 LLaMA-7B 模型,记录了环境配置、通信优化和常见错误解决方案。
文本数据清洗与 Tokenization 工具链搭建
高质量的训练数据是优秀模型的基础。本文分享了我在处理大规模中文文本数据集时使用的清洗流程:去噪、去重、质量过滤、分词与 Tokenization 的完整工具链搭建经验。
混合精度训练 (AMP) 原理与实战:在 RTX 4090 上训练 LLM
混合精度训练利用 FP16 计算和 FP32 主权重,可以在不损失精度的情况下将训练速度提升 2-3 倍。本文详解了 AMP 的工作原理,并记录了在单张 RTX 4090 上训练 7B 参数语言模型的显存优化实践。
复现 Vision Transformer (ViT) 论文:从零实现图像分类
Vision Transformer 证明了纯 Transformer 架构在图像分类任务上的强大能力。本文从零实现了 ViT-B/16 模型,在 CIFAR-100 和 ImageNet-1K 上完成了完整训练,并对比了不同 Patch Size 的影响。
数据集标注工具对比:LabelImg / LabelStudio / CVAT 使用心得
数据标注是监督学习中至关重要的环节。本文对比了 LabelImg、LabelStudio 和 CVAT 三款主流标注工具在图像检测、分割任务中的使用体验,包括安装部署、标注效率与格式导出等方面。
梯度累积与梯度裁剪:稳定大模型训练的实用技巧
当 GPU 显存不足以容纳大 Batch Size 时,梯度累积是有效的替代方案。本文结合梯度裁剪技巧,详细说明了在训练 GPT-2 和 Stable Diffusion 模型时如何稳定训练过程,防止梯度爆炸。
复现 LoRA 微调论文:高效参数微调大语言模型
LoRA (Low-Rank Adaptation) 是一种高效的参数微调方法,可以在不更新全部参数的情况下适配大语言模型到下游任务。本文复现了 LoRA 论文的核心实现,并在 LLaMA-13B 上进行了指令微调实验。