鹏城的秋雨来得突然,打在书房的窗户上,噼啪作响。林晨关掉mini-Gpt的训练日志页面,屏幕上最后一行显示着验证集上的困惑度(perplexity)——一个比初始值低了不少的数字,证明他那个玩具模型确实学到了东西。
成就感是实实在在的,但短暂的兴奋过后,一种更深层的“虚”感浮现出来。
他能搭出架构,能跑通代码,甚至能训练出一个能生成像样句子的小模型。可如果面试官追问:“为什么transformer要用LayerNorm而不是batchNorm”?“多头注意力的‘头’数选择依据是什么?除了论文里说的,你有没有自己的见解”?“最近moE(mixture of Experts)架构火起来了,你觉得它和标准transformer的优劣对比,核心矛盾在哪里”?
他恐怕只能回答出教科书和博客里的标准答案,而缺乏那种基于大量文献阅读和独立思考形成的、属于自己的“技术观”。
“地基还不够深”。林晨对自己说。实践让他有了“手感”,但要想在顶尖技术面试中脱颖而出,甚至未来在t厂那样的地方站稳脚跟,必须对前沿动向和理论基础有系统性的把握。光会调包和实现是远远不够的。
他打开了那个新建的“面试准备”文件夹,在里面又创建了一个子文件夹,命名为“paper_Reading”。
目标明确:系统阅读最近五年(主要2021-2025)AI顶级会议的论文。优先级:NeurIpS(神经信息处理系统大会)、IcmL(国际机器学习大会)、cVpR(计算机视觉与模式识别会议,虽然偏视觉,但很多架构思想通用)。自然语言处理顶会AcL、EmNLp也需关注。
第一步是收集。arxiv(预印本网站)是主战场,但海量论文让人眼花缭乱。他记得一些技术大佬的博客提到过筛选方法:关注最佳论文(best paper)、口头报告(oral)和亮点论文(Spotlight);关注谷歌、meta、openAI等巨头实验室以及斯坦福、mIt、cmU等顶尖高校知名课题组的工作;在知乎、twitter(现x)上跟随一些活跃的研究者,看他们推荐什么。
他花了一上午时间,像蜘蛛结网一样,从一篇引用率极高的2022年NeurIpS最佳论文《transformers are SSms:》开始,通过它的参考文献和引用它的文章,不断延伸,初步筛选出了三十多篇他认为必须精读或至少泛读的论文。主题涵盖:transformer变体与效率优化(如Linear Attention、FlashAttention)、大模型训练技巧(如LLamA系列技术报告)、扩散模型(diffusion)基础、多模态(尤其是视觉-语言模型)最新进展,以及一些看起来就很有意思的新方向,如基于状态空间模型(SSm)的mamba架构。
下午,雨势稍歇。林晨泡了杯浓茶,正式开始了他的“论文攻坚战”。
第一篇选择的是谷歌关于moE架构在大语言模型中应用的详细研究论文。光是摘要和引言就让他反复看了三遍。满眼的“sparsely-activated”、“conditional putation”、“expert capacity”、“load balancing loss”……每个词似乎都认识,连起来却构成了一堵坚硬的术语墙。
他深吸一口气,没有跳过,也没有急着去搜中文博客。而是拿出一个崭新的墨绿色硬壳笔记本——这是苏婉前两天买给他的,说是“奖励他学习用功”——和一支顺滑的钢笔。
“第一步,抄写摘要和核心问题定义,用自己的话复述一遍”。他定下规矩。
笔尖在纸上沙沙作响。遇到不理解的术语,他就在旁边划条线,转到浏览器打开Google Scholar或相关开源项目文档去查。这个过程极其缓慢,读了两页正文,花了一个多小时,笔记本上才记了不到一页。其中大半是他自己的批注和疑问:
“这里说的‘专家’(Expert)其实就是前馈网络(FFN)层?每个token根据路由(Router)选择激活少数几个‘专家’……目的是大幅增加模型总参数量(万亿级别)但保持实际计算量(激活参数量)相对恒定?核心是解决‘大模型’与‘计算成本’的矛盾”?
“负载均衡损失函数……是为了防止某些‘专家’总是被选到,而其他‘专家’闲置?如何确保路由学习的稳定性?”
“Figure 2 的示意图看了半天才懂,路由网络和专家网络是并行的……嗯,有点像去一个超大型自助餐厅,每个顾客(token)先到导购台(Router)拿到推荐菜牌(选择少数几个专家),然后只去这几个对应的餐台(Expert)取菜(计算),而不是跑遍所有餐台。效率的关键在于导购台推荐得准,且各个餐台客流相对均衡。”
这个自助餐厅的比喻让他自己都笑了,但确实帮助他理解了核心思想。他把这个比喻也记在了旁边。
读得头晕眼花时,他就站起来,看看窗外被雨水洗刷得格外清晰的南山科技园建筑群。那些玻璃幕墙大楼里,或许正有人轻松讨论着他此刻绞尽脑汁理解的概念。这种距离感没有让他气馁,反而激起了更强的斗志。
“慢慢来,一篇一篇啃。代码可以跑起来看日志,论文也得一个字一个字读进去,变成自己的理解”。
接下来几天,林晨的生活节奏固定下来:上午,让“启明智投一号”自动运行,简单复盘前一日市场情况和系统信号,偶尔做极小仓位的验证性操作;下午和晚上,全身心扑在论文阅读上。
笔记本上的内容越来越丰富。从moE到FlashAttention(利用GpU硬件特性极致优化注意力计算),从LLamA的技术细节到Swin transformer(计算机视觉中引入层次化窗口注意力的开创工作)……他不仅记论文内容,更记录自己的思考、疑惑、与已有知识的关联,以及那些灵光一现的比喻或联想。
读到一篇关于用强化学习优化大模型解码阶段生成策略的论文时,他联想到自己的“智投一号”在生成交易信号后,其实也有一个“执行”阶段,是否可以借鉴这种“学习式决策”而非固定规则?他在这篇论文的笔记末尾专门留了一页,写下了这个跨领域的想法。
一周后,墨绿色笔记本用了大半。林晨感觉自己的大脑像被重新梳理了一遍,很多之前模糊的概念变得清晰,更重要的是,他看到了这个快速演进领域的地图轮廓和主要路径,而不仅仅是几个孤立的点。
是时候输出了。
他决定把笔记整理成系列技术博客。目的有三:一是巩固学习成果,费曼学习法强调“教是最好的学”;二是构建个人技术品牌,为求职增加筹码;三是或许能获得反馈,甚至结识同行。
平台选择知乎。那里技术氛围相对浓厚,也有不少从业者和研究者活跃。
第一篇博客,他选择了自己理解最透、也觉得最有意思的moE架构。标题斟酌良久,最后定为:《从“自助餐厅”到万亿参数:深入浅出理解moE(mixture of Experts)架构》。他没有直接堆砌论文公式和图表,而是从“为什么需要moE”(大模型规模与计算成本的矛盾)这个根本问题出发,用自己那个“自助餐厅”的比喻贯穿全文,逐步引入路由机制、负载均衡、专家网络等核心概念,最后结合论文中的关键实验结果,讨论其优劣与适用场景。文末,他附上了自己阅读的那篇核心论文以及其他几篇重要参考文献的链接。
写博客又是另一重考验。需要把艰深的技术用通俗而不失准确的语言表达出来,逻辑要清晰,节奏要把握好。他反复修改了三四遍,直到自己读起来觉得顺畅明白,才在某个周二晚上,点击了发布。
发布后,他有些忐忑地刷新了几次页面,只有零星几个阅读。他自嘲地笑了笑,关掉网页,继续去读下一篇关于扩散模型理论基础的论文。这才是主业,博客只是副产品。
然而,两天后的下午,当他完成另一篇关于注意力机制各种高效变体(Linear、Flash、FlashAttention-2等)的博客草稿,准备上传时,顺手点开了知乎后台。
他愣住了。
那篇moE博客的阅读量显示:2.3万。点赞数:487。收藏数:312。评论:89条。
他心跳微微加速,点开评论。
前排高赞评论是:“比喻精妙!终于把moE看懂了,之前读论文云里雾里。感谢作者”! “干货满满,梳理得很清晰,特别是负载均衡那块,比原论文讲得还明白”。 “博主是不是业内人士?理解很深啊”。 “求更新这个系列!期待下一篇”!
也有挑刺和深入讨论的: “关于专家容量(Expert capacity)的公式推导,博主简化了一些条件,实际论文里考虑了溢出(overflow)处理,这里可以补充一下”。 “moE在推理时的延迟问题,博主提到但没展开,这部分其实很关键,特别是在追求低延迟的应用场景”。 “最近有篇新论文提出了更细粒度的moE变体,可以关注一下”。
林晨一条条仔细看着,尤其是那些指出不足或提出深入问题的评论,他不仅看,还认真回复。对于公式推导简化的指正,他承认并表示感谢,承诺在博客里加个注脚说明;对于推理延迟问题,他回复说这确实是moE的挑战之一,并简要提到了几篇针对该问题优化的论文方向。
这种纯粹的技术交流让他感到久违的愉悦。不再是跨境电商群里无休止的扯皮和推诿,也不是失业初期那些泛泛的安慰或打听,而是围绕具体技术点,有来有往,相互启发。他甚至通过评论区,和一个似乎是在读博士的用户简单讨论了几句关于路由网络梯度稳定性的最新方法,对方分享了一篇刚挂在arxiv上的新预印本,林晨如获至宝。
晚上,苏婉批改完作业出来,看到林晨对着电脑屏幕,脸上带着一种专注而柔和的笑意,手指在键盘上敲打着,像是在进行愉快的对话。
“这么高兴?投资系统又赚了”?苏婉走过来,把手搭在他肩上。
“不是钱的事”。林晨侧头笑了笑,指着屏幕,“你看,我写的技术文章,有人看,有人讨论,还有人给我提建议。感觉……像是摸到了那个圈子的边儿”。
苏婉俯身看了看那些评论,虽然看不太懂具体技术内容,但那种积极、专业的氛围她能感受到。“真好”。她由衷地说,“我就说你有真本事。这下更有信心了吧”?
“嗯”。林晨握住她的手,“路还长,但方向好像更亮了”。
他新建了一个文件夹,命名为“blog_Series_AI_papers”,把第一篇博客的源文件和收集到的反馈都放了进去。然后,他将那篇关于注意力机制变体的博客精心修改后,再次发布。
这一次,他心态平和了许多。他知道,持续输出有价值的内容,本身就是最好的积累。这些博客,连同他的mini-Gpt项目代码、论文阅读笔记,都将成为他技术履历中扎实的一部分。
夜深了,鹏城的灯火在雨后的夜空中格外璀璨。林晨最后刷新了一下知乎后台,新博客的阅读数正在稳步上升。同时,他注意到有一条未读的私信,来自一个Id他有些眼熟、似乎在某篇论文作者列表中见过的用户。
私信标题只有两个字:“请教”。