Ilya尘封10年录音曝光!大二入Hinton门下,竟坦言机器学习反直觉
编辑:定慧
【新智元导读】即便在Transformer与ChatGPT尚未诞生的年代,Ilya已敏锐预见深度学习的广阔前景,展现出令人叹服的远见与清醒。这是一段10年前Ilya对于如今AI时代的预言。
Ilya Sutskever因在深度学习方面的远见卓识而闻名。
他现在许多广为流传的言论其实都来自于他在2023年参加Dwarkesh播客时的发言。
此后,直到2025年Ilya创办SSI后,几乎不再有公开的言论,此前曾探讨过Ilya的去向。
扩展阅读:「消失的」Ilya

最近,一位名为Nathan Lambert的博主声称他收到了一段Ilya在10年前,也就是2015年谈论深度学习的语音片段。
令他感到震惊的是,Ilya在那么多年前就已准确预见了这一切,尤其是他的直觉从那时至今几乎没有任何改变。
在进行资料整理,同样震惊我们的是:
早在2015年,Ilya对于深度学习的理解就已经远超如今绝大部分人(即使是10年后今天)。
这个视频片段来自一个已经停播的博客节目《Talking Machines》,我们在其官网找到最初的采访录音。

此时的Ilya还是谷歌的研究员,节目中谈论了他的工作、他是如何对机器学习产生兴趣的,以及为何机器学习(Machine Learning)会和魔法思维(Magical Thinking)产生联系。
现在就让我们将时间回拨10年,看看当年的Ilya是如何洞察深度学习的。
在编辑这篇文章时,我们也惊讶地发现,即使只是通过文字记录,Ilya的观点历经10年岁月洗礼,依然鲜明犀利。

数学出身的Ilya,认为「机器学习」违反直觉
Ilya首先讲述了他通往人工智能的道路,对于这样一位才华横溢的人物来说,这并不令人意外。
我十几岁时就一直对人工智能感兴趣。
我觉得那非常棒而且引人入胜。之后我继续攻读了数学专业本科。
当你学习数学的时候,你会深知数学注重的是证明事物。
如果你看到某种规律,在没有经过证明之前,它并不意味着就是正确的。
因此,对于拥有数学背景的我来说,学习(机器学习)似乎是非常违反直觉的,因为学习强调的是进行归纳推理,而这些归纳步骤看起来很难用严谨的方法去解释清楚。
如果你习惯于严格地证明结果,那么归纳似乎几乎就像魔法一样。
因此,我当时对学习特别感兴趣,因为我深知人类具备这种能力,而从单纯的数学角度来看,学习似乎根本不可能实现,这让我感到不可思议。

大二和Hinton合作
于是我开始四处寻找,结果发现多伦多有一个非常出色且强大的学习研究团队。
我在本科二年级时便开始与Jeff Hinton(AI之父)合作。

相比硬科学,机器学习的理解更加容易
机器学习确实是一门复杂的科学。
我想这不像物理学。
我认为在物理学、数学以及许多其他硬科学领域,一个人需要掌握大量知识后才能开始发挥作用。
虽然我不太确定,因为我从未涉足这些领域。
这只是我的印象。
而机器学习则更多地是,那些重要的想法,甚至是与前沿研究相关的想法,都离表面非常近。
这个观点和我们如今的现状是如此的吻合。
尤其是在一个远离真正训练前沿的实验室中,在没有特别努力寻找的情况下,周围的机器学习的低垂果实之多令人惊讶。
深度学习之所以有效,很大程度上是因为人们愿意付出努力去把握这些机会。
Ilya认为:
只要有正确的指导和方向,无需多年学习就能理解机器学习背后的主要思想、有效方法的主要理念以及主要的直觉认识。

监督学习是机器学习中最成功的领域
Ilya在访谈中谈到,到目前为止(2015年),监督学习是机器学习中最成功的领域。
主持人随后请Ilya解释他最近的工作,Ilya继续深入讲解了深度学习如何得出答案的另一个核心要点。
所以你说,好,数据会告诉我们最佳的连接方式。
因为深度神经网络是一种非常强大、非常丰富的模型,它可以完成很多复杂的任务。
我们很难想象它有哪些事情是无法做到的。
正因如此,每当我们拥有大型数据集时,我们可以应用一种简单的学习算法来找到最佳的神经网络,并取得良好的结果。
因此,我当时致力于将深度监督学习方法应用于神经网络,解决输入是序列、输出也是序列的问题。
从概念上讲,这与我之前所讨论的内容并没有实质差别,主要是一个技术问题。
其关键在于确保模型能够处理输入和输出都是长度不再预先固定的序列。
但它的基本方法是一样的,并且使用了相同的基本学习算法。
因此,再次强调,由于这些模型具有很强的表达能力和功能,它们确实能够解决许多困难的、非平凡的模式识别问题,以及用其他任何手段几乎无法想象能解决的问题。
再者,令人惊讶的是,尽管这种方法最终表现得如此强大,它实际上却非常简单易懂。
学习算法极其简单。也许只需要一个小时,一个聪明的学生就能理解它全部的工作原理。
这个观点也和我们当下的现状极度吻合。
不论是LLM还是Transformer,我们都可以在简单学习后,了解它的基本原理。
甚至就像2023年那次采访的题目,为何「预测下一个单词」这么简单的模型就能超越人类的智能。


只是为了增加数据
在Ilya看来,将深度学习中成功的图像分类技术应用到序列分类(即更接近文本)上只是「一个技术细节」。
人们所做的很多工作更像是在为模型构建数据加载器,而不是我们提出的架构本身有多新颖。
Ilya如此注重数据和通用性,那么后来像Transformer这样的架构席卷整个机器学习领域也许并不会让他感到意外。

神经网络的目标函数非常复杂
它高度非凸。
而且从数学上完全没有任何保证能确保优化成功。
因此,如果你和一位研究优化理论的学者讨论,他们会告诉你,从理论上根本没有理由相信这种优化会奏效。
然而,事实证明它确实能成功——这是经验证明的结果。
纯粹靠理论,我们很难解释太多细节。
并不是因为这里有什么「魔法」,而只是说明我们还没完全搞清楚原理。
我们其实不清楚,为什么这些看似简单的启发式优化算法在这些问题上表现得如此出色。
因为没有任何数学定理或理论可以说明它们必然会成功。
我们真正期待的定理,应该反映「在现有条件下做到最好」这种理念。
然而,人类的智慧并不追求绝对最优,就像我们设计飞机或汽车时也不会力求完美。
我们只需要一个「够好」的工程系统就行。
深度学习和非凸优化给我们的,正是一群「够好」的系统。虽然它们可能不是最优解,却依然非常有用、充满潜力。
这就是事实。

深度学习追求的是「够好」
在许多领域,尤其是学术界,人们过度追求最优,反而忽略了真正重要的目标。
深度学习是一门务实的科学,它在现有资源条件下追求「够好」。
随着数据量和算力的飞速增长,「够好」往往就能带来惊人的成果。
这种「够好」的思路,也让现代人工智能更像「炼金术」而非传统科学.
因为传统科学的进展通常要慢得多。
也许正是这种因为深度学习是务实的,在如今算力爆炸和数据丰富的时代,LLM虽然还是「黑箱」,但已经切实的改变了我们的工作和生活。
某种意义上,也算「预言」了整个LLM时代。

初始化的尺度直接决定了模型的可训性
关于这一点,还有一些不那么直观但非常重要的细节值得讨论。
你可以这样理解:神经网络里有大量神经元和连接,每层都会先将输入乘以随机权重,再经过非线性变换。
第一层处理完后,第二层又会重复相同的过程:乘权重、做非线性变换。
如果这些随机权重太小,信号在多次相乘后就会迅速衰减到几乎为零。
当信号到达输出层时,你几乎感受不到任何输入的影响。
这样一来,学习算法就无法发现输入和输出之间的关联,也就没法改进模型。
因此,我们必须让随机初始化的权重大多数情况下足够大,才能保证输入的变化一路传递到输出层。
一旦满足了这个条件,梯度就能够找到正确的方向,有效地优化网络。
…因此在实际应用中,当研究人员希望在一个真实数据集上训练神经网络时,初始化的尺度是你需要关注的最重要的参数之一。
以上内容节选自音频对话内容,绝大部分来源于Ilya本人。
这就是Ilya 2015年对机器学习的深刻洞察。
那时,距离Transformer发布还有4年,距离ChatGPT发布还有7年的时间。
但是Ilya已经深刻地体会到神经网络的威力。
如果你想要更加深入的了解,可以详细听听上面的音频。
最后想说的是,Ilya对于这场改变我们所有人的科技革命的直觉。就来自于在这次访谈中他想要告诉我们的:追求务实,拥抱简单。
参考资料:
https://feeds.acast.com/public/shows/talking-machines
大家都在看
-
铜合金精密零件加工:黄铜、铍铜、红铜怎么选? 铜材在精密零件里是一个特殊的存在——不像铝合金那么主流,但在特定场合完全不可替代。导电性好、导热性优秀、耐腐蚀性强,是铜材被选择的核心原因。但"铜"不是一种材料。黄铜(Cu-Zn合金)、铍铜(Cu-Be合 ... 机械之最04-28
-
金属材料及热处理基础:盘点7个力学性能关键指标,从原理到应用 在机械制造领域,黑色金属材料的应用占比超 90%,核心原因就是它具备可通过热处理灵活调控、能适配各类复杂工况的力学性能。不管是零件设计选材、热处理工艺制定,还是后期的失效分析,吃透力学性能指标都是绕不开的 ... 机械之最04-27
-
国内史诗级长途自驾,3 万公里跨越南北西东,108 天走完直呼过瘾! 当夕阳把最后一抹金辉洒在帕米尔高原的雪峰上,当车轮碾过东极抚远凌晨四点的第一缕晨光,你会突然明白——有些风景,注定属于那些把梦想刻进车轮的人。这不是一场旅行,这是一次对960万平方公里的致敬。108天,3500 ... 机械之最04-27
-
万亿级大风口!超大“机”遇,来了→ “十五五”规划纲要,将“量子科技、生物制造、氢能和核聚变能、脑机接口、具身智能、第六代移动通信”列为六大未来产业,推动其成为新的经济增长点。具身智能是指拥有物理身体的智能体,人形机器人就是典型的代表之 ... 机械之最04-27
-
机械五虎VS机械四小龙完整版对比!2026报考直接对照选 机械五虎VS机械四小龙完整版对比!分数档位+专业侧重+就业差异,2026报考直接对照选 开篇导语 工科机械报考最纠结:选机械五虎冲顶尖天花板,还是选机械四小龙走高性价比赛道?一份完整版对比表,把分数门槛、王牌特 ... 机械之最04-27
-
首席记者谈首季经济丨江西的新能源产业突围之路 新华社南昌4月26日电 题:江西的新能源产业突围之路新华社记者冯俊扬地处江西上饶的晶科能源股份有限公司稳居全球光伏组件出货量前列;刷新充电速度纪录的比亚迪新一代刀片电池在江西抚州量产……今年1-2月,江西光 ... 机械之最04-27
-
0博士组合拿下ICLR时间检验奖,十年论文终封神 鹭羽 发自 凹非寺量子位 | 公众号 QbitAIICLR 2026时间检验奖新鲜出炉,获奖者——GPT天才本科生Alec Radford。网友们纷纷送来祝贺:“实至名归!”Alec为人相当低调,其社媒清一水的都是转发推荐他人优秀成果。但实 ... 机械之最04-26
-
追光丨专属老年人的“神仙”健身房 你看了“心动”吗? 放眼全国大大小小的健身房早就遍地开花但专门给老年人开的健身房你见过吗?不是公园随便甩甩手也不是小区慢悠悠走两圈而是有专业设备、有运动方案、有指导人员的专业空间一进门先做“全身扫描”↓机器一测个性化运动 ... 机械之最04-26
-
2026北京车展,中国智驾正定义全球标准 编者的话:在全球汽车产业的重心开始向东方倾斜之际,一场规模空前的行业盛宴在北京启幕。4月24日至5月3日,2026北京国际汽车展览会以“世界最大规模车展”的姿态,为全球观众和展商展示汽车技术创新的高地。正如一 ... 机械之最04-26
-
关注“体验经济”丨每年十几万人打卡“小米工厂” 工业游何以这么火? 新华社北京4月25日电 题:每年十几万人打卡“小米工厂” 工业游何以这么火?新华社记者吉宁看流水线上的机械手臂上下挥舞,亲手触摸机械零件实物,一趟行程下来仿佛置身科幻大片,近距离感受中国制造的魅力……近一 ... 机械之最04-26
相关文章
- 万亿级大风口!超大“机”遇,来了→
- 机械五虎VS机械四小龙完整版对比!2026报考直接对照选
- 首席记者谈首季经济丨江西的新能源产业突围之路
- 0博士组合拿下ICLR时间检验奖,十年论文终封神
- 追光丨专属老年人的“神仙”健身房 你看了“心动”吗?
- 2026北京车展,中国智驾正定义全球标准
- 关注“体验经济”丨每年十几万人打卡“小米工厂” 工业游何以这么火?
- 机械键盘选购指南:不同预算怎么选,才能不踩坑?
- 机械设计“进化史”从古代水车到智能机器人,藏着人类的造物智慧
- 机械专业报考建议:在质疑声中看清“工业之母”的真正价值
- 星箭聚力 探秘海南超级工厂
- 一场田间的“精密大考”——天津“优机优补”赋能合作经济一线观察
- 半夜收到一条私信:陈老师,我家孩子985机械电子,校招月薪5500
- 仅次于东道主!约700家中国展商亮相汉诺威工博会
- 央视曝光全球最强光刻机:西方封锁十年,中国早已另起炉灶
- 工业母机的“两岸配方”
- 机械大学生能考哪些证书?2026年高质量就业考证指南与职业规划
- 被机械设计“拯救”的3个日常瞬间,原来它一直在默默帮我们省事
- 为沙漠钉“楔子”——千里河西治沙行
- 商业航天,加速“飞天”(大数据观察·航天日特别报道)
热门阅读
-
天下第一暗器暴雨梨花针,传说中的唐门暗器做出来了 07-13
-
汽车投诉排行榜前十名汽车 问题最多的就是这些车 07-13
-
世界上最牛挖掘机,甚至可以挖穿一座城市 11-05
-
世界最大核潜艇制造厂,产量远超中美法 11-20
