示例笔记 / 机器学习
Attention Is All You Need
Transformer 用注意力机制替代循环结构,让序列建模能够充分并行。更深远的变化,是它把关系建模变成了可以持续堆叠与扩展的通用计算单元。
这里记录论文阅读、技术实验与工程复盘。每篇笔记都尽量说清楚:它解决了什么、为什么有效,以及怎样真正用起来。
不复述摘要,重点整理核心假设、方法依据、证据强弱,以及它对实际工作的启发。
示例笔记 / 机器学习
Transformer 用注意力机制替代循环结构,让序列建模能够充分并行。更深远的变化,是它把关系建模变成了可以持续堆叠与扩展的通用计算单元。
从参数增量的结构出发,理解为什么少量可训练参数也能有效改变模型行为。
梳理检索器、生成器和端到端训练之间的关系,以及它们对实际系统的影响。
把校准、稳健性和分布外表现放在一起,重新理解“模型效果好”的含义。
记录可以复现的实现路径、踩坑过程和设计选择,让一次解决问题的经历成为下一次的起点。
从数据集、检索指标、回答质量到失败样本分析。
把配置、数据版本、指标和产物放进同一条可追踪链路。
兼顾理解、记录和后续复用的一套个人阅读工作流。
我关注人工智能、软件工程,以及如何把复杂概念解释清楚。
写作是检验理解的一种方式。这个网站会持续收录论文阅读笔记、技术实践与阶段性思考,也会保留观点变化的过程。