本系列课程聚焦深度学习演进历程中的关键节点与标志性成果,通过系统研读学术论文,帮助学习者深入掌握经典CNN架构、Transformer及其衍生模型的核心理念。内容覆盖计算机视觉中的图像分类、目标检测、语义分割等主流任务,同时兼顾神经网络优化、正则化策略及评估指标等理论维度的综述分析。课程亦涉及视觉Transformer的最新进展与现存挑战,助力学员全面把握技术脉络。
通过本课程,学习者将有效提升学术论文写作与创新表达能力,学会将前沿成果转化为解决实际问题的工具,为在国际高水平期刊与会议上发表有影响力的研究奠定扎实基础。
课程安排概览:
1. 高效阅读论文的入门方法
2. AlexNet的突破性意义
3. VGG网络结构详解
4. ResNet与残差学习机制
5. Transformer自注意力机制优化
6. EfficientViT:边缘设备上的高效视觉Transformer
7. 视觉Transformer的现状与挑战综述
8. FCN:图像分割的奠基之作
9. U-Net在生物医学图像分割中的应用
10. U-NetV2与U-Net++的演进
11. R-CNN:目标检测的起点
12. Fast R-CNN的改进路径
13. PSUNet:显著目标检测新方法
14. RetinaNet技术要点
15. 网络优化器类型与优劣比较
16. 深度学习与传统视觉方法对比
17. ViT与CNN的性能之争
18. AnchorNet:降低空间冗余加速推理
19. ImageNet数据集的影响力
20. GC-CLIP:提升zero-shot分类性能
21. SAM:通用分割模型解析
22. EfficientSAM的实践优化
23. BLIP2:高效视觉语言预训练
24. GPT-4V在机器人领域的应用
25. RepViTSAM:轻量级SAM实现
26. SM70:医疗场景的大语言模型
27. 大语言模型在电力系统的落地
28. Segment and Track Anything前沿技术
29. MAE:自监督训练ViT的新范式
