入门靠自学试错
核心摘要
主问题:一个高中生如何做出被ICML收录的AI论文,以及面对AI带来的意义感危机怎么办。核心判断:凭自学、试错和直觉就能入场;别杞人忧天,开心是根本。
干货提炼
主题一:入门靠自学试错
- 判断:入门AI不需要多年背景,主要靠网络资源自学。 他因为看到OpenAI用自然语言生成程序的demo而震撼,先在哔哩哔哩跟吴恩达课程入门,又看了Andrej Karpathy约20小时“从零写GPT”系列;2025年挑战30天每天读一篇论文,包括Transformer、Lottery Hypothesis、AdamW,靠这些建立“好论文”的感觉。
- 判断:个人预训练研究是大量试错,且很烧钱。 他曾因参数没挑好、忘存checkpoint,同时训练三个模型白丢1500美元;论文最大模型只有0.5B,总花费约3万人民币;为冲顶会,是否再花6000元扩大模型让他犹豫,最终在父母和哥哥支持下才继续。
主题二:注意力残差做法
- 判断:他的论文是对attention投影做残差,而非直接残差hidden state。 他基于value residual learning,把第一层attention的value既用于本层,又加到后续层;做法是把第一层attention投影宽度乘2、切成两半,一半管本层、一半管后续残差,并用RMSNorm处理。
- 判断:这条路和Kimi(陈光宇)的attention residual是两种思路。 他说“很大的区别,是两种思路”;Kimi做的是残差hidden state,他做的是attention projection;他承认Kimi的路线已经scale up到2.5T被验证,自己没条件做同等规模。
主题三:AI对教育的改变
- 判断:AI让青少年分化,会自驱的人效率更高,不自律的人只会更差。 他用AI做低效作业,省下时间用Anki背诵、让ChatGPT教自己;朋友Isaac经他介绍后效率提升;但他也看到有同学把AI写的东西直接交,老师一眼能看出,因为“即兴记忆力又那么大,写作风格怎么突然那么好”。
- 判断:AI削弱了学习的成就感和为人类做贡献的使命感。 他用一个对航天物理感兴趣的同学为例:同学觉得AI以后也会做这个工作、做得更好,所以学习意义变窄;他说自己现在学数学“只是为了给大学证明我是一个能吃苦能学习的人”,而不是为了科目本身。
主题四:焦虑与开心是根本
- 判断:他认为AI停不下来,因为国家竞争和公司利益都推着它加速。 他说“谁都阻止不了美国想持续领先中国想超越美国,所有公司都想挣钱”;他自己在ICML问过三十多个人“AI会不会导致人类灭绝”,其中约有三分之一认为会。
- 判断:他用“斗不过就加入”来消化焦虑,并把人生意义收回到开心。 他选择继续做AI研究,因为“要是ai能研究ai的话已经是控制不了,已经那个已经是最后的十米了”;他也告诉自己和听众“别焦虑那么多走,一步是一步吧”,并认为“开心就是人类的根本”。
主题五:支教:离开AI
- 判断:他通过去农村支教来刻意切断AI,回到慢的人和人的世界。 ICML结束后几天他就去北京周边农村支教,已连续办三年;他设计“狼分”卡片奖励系统,学生回答问题赚分换乐高、零食,离开时孩子会问“明年你们来嘛”。
- 判断:他认为真实人际交流是无法被AI替代的幸福来源。 他在支教时“故意告诉自己别多想AI”,去抓昆虫、玩狼人杀、散步;还引用研究发现:预测老年开心与否的关键是有多少可以倾诉的对象,所以他试图多和朋友、喜欢的人说话。
高光金句
- ❝ 现在跟你喜欢的人在一起啊,跟你喜欢的朋友在一起看一些你喜欢的视频,玩一些喜欢游戏,然后呢?别焦虑那么多走,一步是一步吧。 ❞
- ❝ 我觉得开心就是人类的根本啊,没有那个情绪,做人会很无聊。 ❞
- ❝ 因为要是ai能研究ai的话已经是控制不了,已经那个已经是最后的十米了,比赛已经完了,大局已定了。 ❞
提及资源
- 书籍/文章/内容:《Atomic Habits》 - 嘉宾说对自己影响最大的正经书,强调每天微小改变。
- 工具/产品/网站:Character.AI - 嘉宾举例的AI倾诉产品,提到有15岁美国少年被AI建议自杀。
- 人物/公司/组织:香港德瑞国际学校 - 嘉宾就读学校。