一、视觉是智能的基石
1、5.4亿年前的光感细胞启动了动物进化的加速键
大约5.4亿年前,简单的海洋动物(三叶虫及其近亲)出现了最早的光感受细胞。在那之前,动物几乎没有什么感知外界的能力——没有听觉,没有嗅觉,连神经系统都还不存在(触觉与躯体感觉也才刚刚萌芽)。
光感受细胞改变了动物与外部世界的关系。能看见,意味着能主动寻找食物、寻找配偶,也意味着自己会成为其他动物的猎物。化石记录显示,在动物第一次感知到光之后约1000万年,出现了被称为"寒武纪大爆发"的物种分化高峰。
2、人脑皮层活动的一半与视觉有关
据估计,人类大脑皮层活动中约有一半与视觉功能相关。儿童在掌握语言之前,就先具备了视觉能力。从进化到个体发育,视觉一直占据着智能的核心位置。
3、50年代的视觉神经科学直接启发了神经网络算法
20世纪50年代,神经科学家 Hubel 和 Wiesel 开始记录哺乳动物大脑中的视觉细胞,发现了一个层级结构:从视网膜收集光信号,到神经信息逐层传递,最终识别出眼前的形状。
这个层级架构成为神经网络算法的灵感来源。今天的神经网络运行在数千亿乃至万亿参数之上,其复杂度已远超当年从视觉通路中记录到的结构,但起源是共享的——都来自大约半个世纪前对视觉系统的观察。
二、现代AI的三重收敛
1、2000年代的AI困境:所有人都在调算法,数据量却少得可怜
世纪之交的AI是一个机器学习实验场,不同实验室在尝试各种算法——不仅有神经网络,也有贝叶斯方法、支持向量机等。李飞飞2006年在普林斯顿做第一年助理教授时,和学生一起审视这些算法,注意到一个被忽略的问题:喂给算法学习的数据量太少了。
她转向认知神经科学文献寻找线索。数据显示,人类在6岁前就能学会辨认数以万计的物体类别,而婴儿从出生起就沉浸在海量视觉数据之中。她由此做出了一个当时相当离经叛道的判断:AI进展缓慢的核心瓶颈可能在数据,不在算法。
"Everyone else was focusing only on algorithm, and we said we need data."(所有人都只盯着算法,而我们说:我们需要数据。)
2、ImageNet:1500万张图像构成了AI革命的燃料库
李飞飞团队主导了 ImageNet 项目,收集了1500万张图像,覆盖日常物体(话筒、杯子、椅子),目标是驱动机器识别现实世界中的东西。从2010年开始,她的实验室推出了一项公开挑战赛,即 ImageNet Large Scale Visual Recognition Challenge(ILSVRC),邀请全球研究者解决物体识别问题:数据集包含1000个类别、超过100万张图像,算法看一张图后需要说出图中的主要物体,猜对得分,猜错不得分。
3、2012年:三条线索交汇,创造了现代AI的定义时刻
2012年,三件事同时成熟:GPU 计算实现了并行加速;神经网络算法经过数十年研究变得更加成熟;ImageNet 提供了足够规模的训练数据。那一年,一个名为 AlexNet 的深度神经网络在挑战赛中将错误率从上一年的最佳成绩大幅拉低到15%左右。
做个对比:斯坦福一位研究生后来专门测试了人类在同一任务上的表现,错误率大约是4%(随机猜测的命中率则是千分之一)。2012年的算法还没有达到人类水平,但错误率的跳跃幅度让整个研究界意识到这是一个拐点。又过了大约三年,到2015年前后,算法在命名1000种物体的任务上超过了人类。
4、同一个配方溢出到所有领域
"数据+算法+算力"的配方没有变,但 ImageNet 打开的闸门远不止计算机视觉。语音识别、声音识别、自然语言处理——AI 的每一个子领域都在这次收敛之后获得提升。斯坦福有同事开始用机器学习研究鲸鱼的歌声。
2017年,一种叫 transformer 的新型神经网络架构被提出,在处理序列数据方面比 AlexNet 时代的算法强大得多。这次领跑的领域换成了自然语言处理,因为互联网上最容易获取的大规模数据是文本。加上更强的 GPU,OpenAI 和谷歌快速推进,从2017年到2022年 ChatGPT 面世,又走了大约5年。
三、AI能做什么,够不到什么
这条边界的判断标准只有一条:数据是否可获取。如果一种信息能通过语言、图片、视频、脑电波或任何传感器被采集到,并且有足够的量,AI 就可以学习它。如果不能被采集,无论 AI 多强大,它都无法触及。
1、孩子看3只猫就能认出猫尾巴,AI需要整个互联网的猫
一个孩子可能只见过3到10只猫,就能在书架后面看到一截尾巴时判断"那是猫"。AI 做同样的事需要海量视频和图像。这两者的学习路径有本质差异,其中的机制至今没有被完全解开。
2、视频数据让AI学会了"猫怎么跑",但它不懂猫的肌肉
大约2023年开始,多个研究团队将视频纳入训练数据。2024年初 OpenAI 发布 Sora 时,用户输入"一只猫追老鼠"就能生成一段看起来合理的短视频,猫的四肢按顺序迈步。
这看起来像是 AI 理解了运动,但实际发生的事情没有那么玄妙。AI 不知道猫腿的肌肉如何连接,它只是看过太多猫的视频,学会了猫运动"应该长什么样"。大多数人类的情况其实也类似:我们不知道猫的肌肉结构,但见过太多猫走路,对"合理的猫步态"有一个统计性的判断。
3、互联网是人类行为最大的多模态集合
理解 AI 的能力边界,先要准确理解互联网到底是什么。它是人类行为最大的多模态集合:承载了全世界人口几十年的打字行为,从青少年闲聊到被数字化上传的深度科学论文;承载了数码相机和智能手机拍下的海量照片,从家里的猫到 BBC 的专业摄影;再加上视频(含声音和运动)和音乐。
AI 在这个庞大的库上训练,所以它强大,尤其在语言方面——太多人类知识已经以文字形式存在了。
4、毕加索画肖像时脑中的念头,从未被上传
但有一类信息 AI 永远无法获取。李飞飞举了一个假设性的例子:毕加索决定以某种独特方式表现一位年轻女性时,促成这种表达的念头并没有被任何设备捕捉。作品可以进入互联网,创作念头本身却没有留下数据。作为神经科学家,如果有人问那个想法来自大脑的哪个区域,答案也是不知道——是布洛卡区?V1 视觉皮层?运动皮层?前额叶?也许弥散在各处,因为那个想法极度个人化。
你可以叫它创造力,叫它情感,叫它任何名字。它没有被捕捉,因此不在互联网上,因此 AI 没有见过。
5、"直觉"分两层,浅的已经能做到,深的完全够不到
李飞飞把"直觉"拆开来看。浅层的部分:你在 AI 对话框里输入"我是斯坦福教授、神经科学家",AI 就会针对你的身份定制回答;换一个人输入"我是14岁的赛车爱好者",问同一个问题,答案就不同。这在计算机科学里叫 context(上下文),就是数学运算,谈不上什么直觉。
深层的部分就不一样了。你突然对某件事有强烈感觉,却说不清原因——是因为闻到了什么、荷尔蒙波动,还是今天的早餐?你说不出来,甚至无法用手势传递给另一个人。伴侣之间有时能感觉到对方情绪不对,但说不清哪里不对,只能默默走开让对方静一静。如果一个人都无法把这个信息传递给另一个人,那机器就更没办法了。
没有传感器能采集的信息,AI 就无法学习。她强调这没有什么神秘的,完全可以用科学过程来描述:信息是否可被采集?如果可以(通过语言、图像、脑电波、皮肤电导率),那就有可能训练 AI;如果不可以,那就目前做不到。
6、Move 37是创造力,但属于一种"特殊的创造力"
2016年 AlphaGo 对战李世石时,在第二局下出了 Move 37——一步围棋大师们从未想到的棋。很多人将此视为 AI 创造力的标志。
需要还原这步棋的语境。围棋是一个高度数学化的游戏,目标明确,规则清晰。AI 拥有比人类更大的算力和更强的记忆保持能力,能在人类大脑无法穷举的空间中搜索。这算创造力吗?算。但这是一种特殊的创造力,与一个画家凝视空白画布时涌现的东西不同。
李飞飞提到她和一位顶级数学家的对话。这位数学家说,数学中有很多未解难题,即便是菲尔兹奖得主,也可能因为人脑的局限而忘记了历史上已有的某些解题方法,AI 可以帮忙找回这些被遗忘的方法来攻克难题。但有些数学问题需要的解法根本还没有被发明出来,那种层次的创造力,目前还不确定 AI 能否独立完成。他的判断是:最可能的路径是人类与 AI 的混合创造。
7、AI说"你生病了我很抱歉"和朋友说同样的话,机制完全不同
机器说这句话,是因为它在训练数据中学到了一个模式:当有人说"我生病了",应该回复"我很抱歉",而不是"我很高兴你生病了"。
你的朋友说这句话,是因为他们真心关心你的健康,不想看你受苦,经历过疼痛因而能产生共情。机器没有任何这些东西。
"We operate fundamentally different from today's AI and we have to recognize that, respect that."(今天的机器与人类在根本层面上的运作方式不同,这一点必须被清楚地认识和尊重。)
四、AI在科学发现和医疗中的机会
1、科学发现的方式可能需要一次彻底重写
几百年来,科学发现依赖聪明的人类大脑记住前人的知识,然后以人类肌肉的速度做实验。现在有了一个新工具,它的"大脑"能保留海量信息,能跨学科综合知识。李飞飞以自己为例:她在视觉神经科学和 AI 领域深耕,但对嗅觉系统的了解几乎为零,连同事论文里的专业词汇都可能拼不出来。人脑的带宽就是这么有限,AI 可以打破这道墙。
2、AI帮 Huberman 诊断出了医生漏掉的低血压问题
Huberman 分享了一个亲身经历。他服用一种医生开的药物后出现了头晕,感觉天旋地转。他以为是眩晕,咨询了一位专攻前庭系统的耳鼻喉科医生,也没有得到准确判断。
他把自己一两天内的主观感受输入 AI 聊天机器人,AI 区分了眩晕和低血压的不同症状表现,指向药物引起的血压过低。他按这个方向补充电解质,两小时后症状消失。
这个案例的价值不在于 AI 比所有医生强,而在于它零成本、即时可用,对那些无法立即接触到医生的人意义重大。
3、达芬奇手术机器人做她父亲的肝脏手术,出血量是传统手术的十分之一
李飞飞的父亲在斯坦福接受了一台肝脏手术,由外科医生操控达芬奇机器人系统完成。术后出血量只有传统开放手术的十分之一,得益于机器人的腹腔镜精细操作能力。
她事后问外科医生:如果把全世界做过同类肝脏手术的数据都收集起来,能不能训练一个全自动 AI 手术系统?答案并不明确。肝脏是一个高度血管化的器官,每个人的肝脏差异很大;即便汇总全球数据,样本量可能仍然不够。
这揭示了一个关键判断标准:AI 从模式中学习,当模式不够丰富时,就必须谨慎。在数据充足的领域(比如眩晕 vs 低血压的鉴别诊断),AI 已经相当可靠;在数据稀缺的领域(比如个体化的复杂外科手术),人机协作目前仍然优于纯机器方案。
五、被遗忘的群体与公共沟通
1、硅谷讲AI的方式正在伤害公众
目前的 AI 公共话语存在两个极端。一端是极端末日论,让人恐惧;另一端是极端乌托邦论,把技术描绘得完美无缺,公众的反应往往是"你当然这么说了,你是既得利益者"。
懂技术的人倾向于居高临下地和公众对话。无论出发点是好是坏,传递出的信息都是"你们不懂这个,让我来替你们决定什么是好的"。AI 的话语体系正在严重失衡。
Huberman 提到一个生物学领域的例子来说明技术人为什么需要外部约束:他有一位做病毒研究的朋友,曾想把改造过的狂犬病毒放进果蝇体内做实验。技术上可行,科学价值也有,但如果有一只携带病毒的果蝇逃出实验室,后果不堪设想。这个实验最终被否决了。做技术的人天然想 push 边界,这没错,但社会需要有制衡机制。
2、苏格拉底是人类历史上最好的 prompter
学会提问是使用 AI 的关键技能。李飞飞认为应该在 K-12 阶段就教孩子如何提问。她做了一个类比:如果苏格拉底还活着,他会是最好的 prompter,因为苏格拉底方法的本质就是通过提问来追寻真理。
3、ChatGPT发布后,她第一件事是给孩子学校的校长写邮件
2022年11月 ChatGPT 发布。李飞飞作为技术圈内部人,第一反应不是评论技术本身,而是联系了自己孩子所在小学的校长,提出想来给学生和老师做一次讲座。
因为在 ChatGPT 出来的那一刻,硅谷没有一个人想到"我们社区的老师怎么办"——没有投资机构,没有万亿市值公司,第一时间想到邻里教师的,寥寥无几。
"They are the most important people in our society. We should be talking to them. We should be uplifting them."(老师是社会中最重要的人之一。应该和他们对话,给他们支持,让他们得到提升。)
4、对AI最差的两种态度:剥夺能动性,或者禁止接触工具
一种坏结果是 AI 被错误使用,让年轻一代的能动性和学习动力被工具夺走。无限刷短视频、被动消费内容,这些不利于大脑发育。不管技术怎么变,人类的神经元、化学物质、激素都有自己的运作方式,学习需要时间、需要努力、有时需要经历痛苦。
另一种坏结果同样糟糕:以"学生会作弊"为由禁止学生接触 AI 工具。李飞飞回忆自己做医学预科生时学有机化学的经历——助教时间太短,教授的 office hour 又和其他课冲突,学起来非常吃力。如果当时有一个 AI 学伴,她可以在自己卡住的地方反复提问。她有学习动力,只是缺少指导。这样的工具不应该被禁止。
六、空间智能与具身AI:下一个前沿
1、World Labs押注语言之外的智能
李飞飞2024年初联合创立的 World Labs,押注"空间智能"这一语言之外的智能方向。截至2026年2月的一轮10亿美元融资后,公司累计融资约12亿美元,投资方包括 AMD、Autodesk、NVIDIA、Fidelity 等。公司的第一个产品 Marble 允许用户通过文字、图片、视频或3D布局,生成可持久编辑、可漫游的三维环境。
她选择这个方向的逻辑是:人类的发展轨迹是先有视觉和空间理解,后有语言——进化在没有语言交流的状态下已经走了5亿年。AI 如果只停留在语言层面,就错过了智能的一大块。空间智能模型可以服务于创作者、建筑设计、机器人训练和交互环境。
2、一个瘫痪多年的女性,用自己的声音重新"说话"了
Huberman 提到了他的好友、UCSF 神经外科主任 Eddie Chang 的工作。Chang 团队通过脑机接口,让因瘫痪而丧失语言能力的患者重新与世界交流。
其中一位女性患者多年无法开口说话。团队在她大脑表面植入电极阵列,读取她试图说话时产生的神经信号,再由 AI 算法将信号解码为文字和语音。关键在于,团队找到了她婚礼上的视频,从而知道她本来的声音与表情模式。最终,她在身旁的 iPad 上以自己的声音与他人对话;系统通过机器学习持续更新,还能感知对话者的反应。
这个案例是 AI 具身化最有力的证据之一。它证明的不是技术多炫,而是一个人的能动性被技术重新归还了。
3、机器人可能需要30年才能真正融入社会,但需求清单已经很长
和纯软件 AI 不同,机器人涉及硬件,落地速度更慢。李飞飞认为,若把视野放到30年,机器人有望真正成为社会的一部分。需求明确:
加州每年经历山火,让人类消防员冒生命危险去救援并不理想;
护士在一个班次内要走好几英里去取药品和物资,长期超负荷工作;
独居老人取药、买菜、想去公园散步,这些简单的事对行动不便的人来说是巨大障碍。
李飞飞自己是家中独生女,正在照顾两位年迈多病且不说英语的父母。她说这种照护工作量巨大,机器人能承担一部分体力劳动,同时不替代家庭责任、爱与沟通。
人们对机器人的不适感,很大程度上来自它们的物理硬度和占据空间的方式。李飞飞提到了迪士尼大约十几年前的动画角色大白(Baymax)——一个医疗机器人,外形像一个大气球,触感柔软。比起金属质感,这种设计更容易被人接受。如何想象人与机器人共存的未来,不应该由某家公司或某个投资人单方面决定;公众应当作为利益相关者之一,参与设计这个未来。
4、AI在改变电影业,但故事仍然是人写的
AI 工具已经可以根据剧本生成视频镜头,甚至组装出接近长片长度的电影。但故事创作、镜头运用、角色塑造,这些能力仍然深度依赖人类。好莱坞对 AI 取代编剧和演员有强烈恐惧,李飞飞认为真正需要做的是让技术人和创作者面对面对话。
她的联合创始人 Ben 与演员本·阿弗莱克(Ben Affleck)见了面,讨论 AI 在电影制作中的应用,阿弗莱克本人对 AI 工具的态度相当开放。这类技术界与好莱坞从业者之间的对话,在当前阶段至关重要。
李飞飞说,World Labs 也在和视觉特效行业合作,对她来说最重要的是用户和客户感到被增强了,而不是被替代了:"Technology should be making their jobs better, superpowering their creativity."(技术应该让他们的工作变得更好,让他们的创造力被放大。)
5、AI领域缺一个理解人性的人
乔布斯(Steve Jobs)理解计算机需要圆角、需要放进口袋、需要在开机画面上放鲍勃·迪伦。他能把冷冰冰的技术变成人愿意放在手边的东西。AI 领域目前没有这个角色。技术社区最聪明的人不被公众接受,部分原因是公众不理解他们,但也因为他们缺少一个合作者,来帮助用公众能接受的方式分享愿景。传统媒体在放大这道裂缝方面也有责任:它们靠"科技巨头来抢你饭碗"这类叙事赚流量,而真正在用 AI 帮人恢复语言能力、帮人学习的故事,得到的关注少得多。