1. 从一条日报说起:为什么"Claude破解30年难题"和"果蝇全脑上传"值得单独拎出来聊
3月10日这条AI日报里塞了两件事,一件是Claude在某个悬置了三十年的科学问题上给出了突破性结果,另一件是果蝇全脑被完整上传。乍一看像是两条互不相干的新闻拼在一起,但如果你平时就在跟踪大模型的能力边界和神经科学的前沿进展,会发现这两件事其实指向同一个趋势:AI正在从"会聊天、会写代码"往"能参与真实科研推理"这个方向走,而且走得比大多数人预期的要快。
我自己是从Claude Code这个工具开始真正把大模型用进日常工作流的,所以对"Claude"这个名字有天然的关注。这次它被拿来和"破解30年难题"挂钩,第一反应不是惊讶,而是想搞清楚:它到底解的是什么题?是数学猜想、材料结构预测,还是生物里的某个长期悬案?因为不同领域的"30年难题"含金量差别极大,有的是真突破,有的只是媒体标题党。同样,"果蝇全脑上传"听起来很科幻,但果蝇大脑大约有十几万个神经元,连接组(connectome)早就被测绘过,真正难的是把结构图变成能跑起来的动力学模型——这两件事放在一起,恰好构成了一条从"AI辅助推理"到"AI模拟生物智能"的完整链条。
这篇内容适合几类人看:一是想搞清楚这波AI科研进展到底是不是真货的技术从业者;二是正在用Claude、Claude Code这类工具做开发或研究,想知道它能力天花板在哪的人;三是对神经科学、类脑计算感兴趣,想了解"全脑上传"到底上到什么程度的人。我会尽量把每条新闻背后的技术逻辑拆开讲,不堆术语,也不吹不黑,该说清楚的地方说透,该存疑的地方标出来。
2. Claude这次"破解30年难题"到底解了什么:先分清三种可能的含金量
2.1 科学界"30年难题"的三种典型形态
在聊Claude之前,得先建立一个判断框架。所谓"悬置30年的难题",在科研语境里通常分三类,含金量和验证难度完全不同。
第一类是纯数学或理论物理里的猜想,比如某个数论命题、某个对称性破缺的解析解。这类问题的特点是:一旦被证明或证伪,结论是硬的,对就是对,错就是错,没有模糊地带。但大模型在这类问题上的表现一直很微妙——它能给出看起来很像证明的推理链,但中间经常藏着一步"想当然"的跳跃,外行看不出来,内行一眼识破。
第二类是计算或数据密集型难题,比如蛋白质折叠、材料相图预测、气候模型里的某个参数反演。这类问题的"破解"往往不是给出一个优雅的定理,而是找到一个能稳定复现、误差可控的计算路径。大模型在这里的价值是加速搜索和提出候选方案,真正的验证还得靠实验或高精度数值模拟。
第三类是概念性或框架性难题,比如某个长期争论的机制解释。这类问题的"破解"更像是提出一个自洽的新框架,能不能被接受要看后续同行评议和实验支持,短期内很难下定论。
Claude这次被报道的"破解",从措辞看更接近第二类或第三类——因为如果是第一类纯数学突破,通常会有明确的论文和证明过程公开,媒体不会只用"破解"这种模糊词。我的判断是:它大概率是在某个计算或推理任务上给出了此前人类没走通的路径,或者把某个长期卡住的搜索空间大幅压缩了。这种成果的价值在于"打开了新方向",而不是"一锤定音"。
2.2 大模型参与科研推理的真实能力边界
我实际用Claude做过一些偏推理的任务,包括读论文、复现公式推导、找代码里的逻辑漏洞。体感是:它在结构化推理上确实强,比如给你一段实验描述,让它推断可能的误差来源,它能列出七八条,其中三四条是真正相关的。但在需要严格形式化的环节,比如多步代数推导、边界条件讨论,它仍然会犯低级错误,而且错得很自信。
所以当看到"Claude破解30年难题"这种标题时,我的第一反应是去区分:这次是它独立完成的,还是它作为工具辅助人类研究者完成的?这两种情况的意义完全不同。如果是前者,那说明大模型在长链条推理上有了质变;如果是后者,那它更像是一个超级计算器加文献助手,价值依然很大,但没那么"炸裂"。
从目前公开的信息密度看,更可能是后者——人类研究者提出问题和验证方向,Claude负责在巨大的假设空间里做筛选和初步推演。这种协作模式其实才是当下AI科研最现实的形态,也是我认为最值得关注的地方:不是AI取代科学家,而是AI把科学家从"穷举式试错"里解放出来。
2.3 怎么验证这类"突破"是不是真货
给几个实操判断标准,下次再看到类似新闻可以直接套用。
- 看有没有可复现的中间产物:真正的计算类突破,通常会放出代码、数据集或至少详细的算法描述。如果只有一段新闻稿,没有可验证的细节,先打个问号。
- 看同行反应的时间线:重大突破出来后,相关领域的学者会在几天到几周内给出初步评价。如果一个月过去还是只有媒体在转,没有专业社区的讨论,那大概率是包装过的。
- 看"30年"这个数字怎么来的:有些问题被说成"悬置30年",其实中间已经有过多次部分进展,只是没彻底解决。这种"30年"是营销话术,不是科学史事实。
- 看结论的适用范围:如果报道里说"解决了XX问题",但没说在什么条件下、什么规模下成立,那就要警惕。科学结论几乎都有边界条件。
提示:判断AI科研新闻的含金量,最省事的办法是去查原始论文或预印本,看摘要里的"we show that"后面跟的是什么。如果跟的是一个非常窄的结论,那新闻标题多半夸大了。
3. 果蝇全脑上传:十几万神经元是怎么被"搬"进计算机的
3.1 果蝇大脑的规模与连接组测绘的前置工作
果蝇全脑上传这件事,得先摆事实:成年果蝇大脑大约有十几万个神经元,突触连接数量在千万级。这个规模在神经科学里属于"刚好能被完整测绘,又复杂到能产生真实行为"的甜蜜点。比它小的如线虫只有302个神经元,早就被完整测了;比它大的如小鼠有上亿神经元,目前还只能做局部。
连接组测绘的核心工具是电子显微镜切片+自动图像分割。把大脑切成几千到上万片超薄切片,逐片成像,然后用算法把每片里的神经元轮廓和突触连起来,最后拼成三维图。这个过程里最耗时的不是成像,而是proofreading——算法分割会出错,需要人工或半自动修正。果蝇全脑的连接组项目(比如FlyEM)前后做了很多年,投入了大量人力。
所以"全脑上传"这个说法,严格讲应该叫"全脑连接组+部分功能标注的数字化"。它上传的是结构,不是状态。这点必须说清楚,否则容易被误解成"把一只活果蝇的意识复制进去了"。
3.2 从结构图到可运行模型:缺失的那几步
有了连接组,离"能跑的模型"还差好几步,这几步恰恰是最难的。
第一步是神经元类型标注。连接组告诉你"谁连谁",但不告诉你每个神经元是兴奋性的还是抑制性的、用什么神经递质、有什么离子通道。这些信息得靠其他实验手段(免疫染色、单细胞测序)补,而且目前只能覆盖一部分。
第二步是动力学参数估计。每个突触的强度、延迟、可塑性规则,这些都不是连接组能直接给出的。常见做法是用简化的神经元模型(如泄漏积分放电模型)加上从电生理实验里拟合的参数,先搭一个"够用"的仿真。
第三步是行为验证。模型搭好后,要让它复现果蝇的某些真实行为,比如趋光、避障、求偶序列。如果仿真出来的行为模式和真实果蝇对不上,说明模型里缺了关键机制。
我个人的看法是:果蝇全脑上传目前更接近"高保真结构图谱+初步功能仿真",离"完整数字孪生"还有距离。但它的意义在于,这是第一个在全脑尺度上把结构和功能往一起凑的尝试,方法论价值远大于当前模型的精度。
3.3 全脑仿真对AI研究的实际意义
很多人会问:模拟一只果蝇有什么用?又不能拿来干活。这个问题问得好,答案在机制发现上。
当前的大模型本质上是黑箱,我们知道它有效,但不太清楚它为什么有效。而果蝇大脑是一个已知结构、可干预、可观测的系统。你可以在仿真里敲掉某个神经元,看行为怎么变;也可以对比真实果蝇做同样操作的结果。这种"结构-功能"的因果链条,是理解"智能如何从连接里涌现"的最佳实验场。
另一个意义是算法启发。果蝇的嗅觉学习、导航、决策回路已经被研究得很细,里面有些机制(比如稀疏编码、侧抑制)已经被借鉴到机器学习里。全脑仿真能把这些机制放在一个完整系统里看它们怎么协同,这比单独研究一个回路更有价值。
注意:全脑仿真和"上传意识"是两回事。前者是科学建模,后者是哲学命题。把两者混为一谈,既高估了当前技术,也低估了意识问题的难度。
4. 把两条新闻串起来看:AI正在从"工具"变成"科研协作者"
4.1 大模型在科学发现链条里的位置
把Claude破解难题和果蝇全脑上传放在一起,能看到一条清晰的链条:AI既在帮人类做推理,又在被用来模拟智能本身。
在科学发现的链条里,大模型目前最成熟的位置是假设生成和文献综合。给定一个领域的大量论文,它能快速梳理出"哪些方向试过了、哪些没试过、哪些矛盾还没解决"。这一步以前靠博士生读几个月文献,现在几小时能出初稿。虽然初稿需要专家审,但效率提升是实打实的。
再往上游走是实验设计,比如给定一个目标分子,让模型提出几条合成路径。这一步它做得还不够可靠,因为涉及真实世界的约束(试剂可得性、反应条件、安全规范),模型容易给出理论上可行但实操上不靠谱的方案。
最下游是结果解释,也就是从数据里找模式、提机制。这一步大模型的表现参差不齐,在结构化数据上还行,在需要物理直觉的地方经常翻车。
4.2 神经科学仿真与大模型训练的相互喂养
果蝇全脑仿真和大模型训练之间,其实存在一个潜在的双向通道。
一个方向是从神经科学到AI:果蝇的某些回路机制(比如蘑菇体里的稀疏编码)已经被证明对学习任务高效,这些机制可以被抽象成新的网络结构或训练技巧。全脑仿真提供了更完整的验证环境,能看出哪些机制是真正关键的,哪些只是冗余。
另一个方向是从AI到神经科学:大模型本身就是一个"人工神经系统",它的训练动力学、表征几何、泛化行为,可以反过来给神经科学提供假设。比如"为什么大脑需要睡眠"这个问题,就有研究用人工网络的训练稳定性来类比。
这两个方向的交汇点,就是类脑计算。它既不是纯粹模仿大脑,也不是纯粹堆算力,而是取两者之长。果蝇全脑上传这类工作,为类脑计算提供了目前最精细的"参照系"。
4.3 普通开发者能从这波进展里拿到什么
说了这么多宏观的,回到实操层面:如果你是一个普通开发者或研究者,这两条新闻对你能有什么直接帮助?
第一,Claude这类模型在推理任务上的能力,已经可以拿来处理你手头的复杂问题了。比如你有大量日志要分析根因、有复杂的配置要排查冲突、有一堆论文要提炼方法,这些任务它做得比一年前好很多。关键是学会怎么给它结构化的输入和明确的验证标准。
第二,果蝇全脑的数据和仿真工具很多是开源的。如果你对计算神经科学感兴趣,可以下载连接组数据,用现成的仿真框架(如Brian2、NEST)搭一个小回路跑跑看。这是理解"神经网络到底怎么工作"的最直接路径,比看教科书强。
第三,关注这两个领域的交叉工具链。比如现在有些工具能把神经连接组转成脉冲神经网络,再放到GPU上跑。这类工具目前还比较小众,但用的人会越来越多,早接触早受益。
5. 实操视角:用Claude Code把这类科研信息变成可复用的工作流
5.1 为什么我选择Claude Code而不是纯网页版
聊到具体怎么用,我得先说说为什么从网页版Claude转到了Claude Code。网页版适合问答,但科研信息处理往往是多步骤、要留痕、要反复迭代的。比如你要跟踪一个领域的最新进展,流程大概是:抓取预印本→提取方法→对比已有工作→标记矛盾点→生成待验证假设。这一串操作在网页版里得手动复制粘贴,很容易断片。
Claude Code是命令行形态的,能直接读写本地文件、跑脚本、调工具。这意味着你可以把整个流程脚本化:让它读一个目录下的PDF,输出结构化的摘要,再基于摘要做二次分析。整个过程可复现、可版本控制,这对科研跟踪来说太重要了。
安装上,Mac和Windows都有对应的方式,Windows下如果遇到虚拟化相关的提示,按官方文档开启对应系统功能即可。配置环节最容易卡住的是base_url和API key,如果报"缺少base_url配置"这类错误,基本就是配置文件里provider那段没写全,补上就行。
5.2 搭建一个"AI日报自动摘要"的最小工作流
下面是我实际在用的一个最小工作流,用来处理每天的AI相关新闻和论文。
第一步,准备一个输入目录,把当天的链接、PDF、或者纯文本丢进去。文件名带上日期,方便后续检索。
第二步,写一个提示词模板,核心是让模型做三件事:提取核心主张、标注证据强度、列出待验证点。模板大概长这样:
你是一个科研信息分析助手。请阅读以下材料,输出: 1. 核心主张(一句话,不超过50字) 2. 支撑证据(列出材料中提到的具体数据、实验、引用) 3. 证据强度(强/中/弱,并说明理由) 4. 待验证点(列出材料中没有说清楚、需要进一步查证的地方) 5. 与已知工作的关系(如果有,指出是延续、反驳还是独立) 材料: {{content}}第三步,用Claude Code批量跑这个模板,输出到一个Markdown文件里。跑完之后你得到的就是一份结构化的日报,比原始新闻稿信息密度高得多。
第四步,定期回顾。每周把这一周的摘要合起来看,找重复出现的主题和矛盾点。矛盾点往往就是下一个值得深挖的方向。
5.3 处理"证据强度"判断时的几个坑
这个工作流里最容易出问题的是证据强度判断。模型倾向于把话说得比较满,尤其是面对看起来权威的来源时。我踩过的坑有这么几个:
- 把预印本当同行评议论文:预印本没经过正式评审,证据强度天然要降一档。提示词里要明确要求区分。
- 把相关性当因果:材料里说"A和B同时出现",模型可能总结成"A导致B"。要让它明确标注因果关系的证据类型。
- 忽略样本量:小样本研究和大规模重复实验的证据强度差很多,但模型经常一视同仁。可以在提示词里要求它提取样本量信息。
- 对"突破"类词汇过度敏感:媒体爱用"突破""首次""颠覆",模型容易被带节奏。要让它把这些词当成待验证信号,而不是结论。
提示:判断证据强度时,最实用的一个问题是"如果这个结论是错的,最可能错在哪里"。让模型回答这个问题,往往能暴露出它自己都没意识到的薄弱环节。
6. 从果蝇到通用智能:全脑仿真路线上还没解决的核心问题
6.1 尺度问题:从十几万到上千亿的鸿沟
果蝇十几万神经元,人脑八百多亿。这个差距不是"多堆点算力"就能填的。连接组的测绘成本随神经元数量增长得非常快,果蝇做了很多年,小鼠目前只能做局部,人脑在可预见的未来都做不完。
更麻烦的是仿真成本。即使有了完整连接组,要实时仿真十几万神经元的脉冲动力学,用普通GPU还能勉强跑;到了百万级就得用超算;到了人脑级,按目前的算法效率,需要的算力是天文数字。所以全脑仿真这条路线,短期内只能在小系统上做原理验证。
6.2 可塑性问题:连接组是快照,不是电影
连接组测的是一瞬间的结构。但真实大脑的连接是动态变化的——学习、记忆、发育都在改连接。果蝇全脑上传拿到的是"某一只果蝇在某个时刻的连接图",它没法告诉你这只果蝇昨天学了什么、明天会忘什么。
要模拟可塑性,得在仿真里加入学习规则。但学习规则本身是什么,目前还没有统一答案。Hebb规则、STDP、三因子规则,各有各的适用范围,放到全脑尺度上怎么组合,是个开放问题。
6.3 验证问题:怎么知道仿真"像"真实大脑
最后一个坑是验证。你说你的仿真复现了果蝇的趋光行为,但"像"到什么程度算成功?行为层面的相似可能掩盖机制层面的错误——两条完全不同的回路可能产生同样的行为输出。
严格的验证需要多层级对比:行为层、回路层、单细胞层、突触层,每一层都要有可测量的指标。目前大部分仿真工作只能做到行为层和部分回路层的对比,再往下就缺乏数据了。这也是为什么我说果蝇全脑上传目前更像"方法论里程碑"而不是"完整数字孪生"。
7. 给不同背景读者的上手建议
7.1 如果你是开发者,想蹭这波AI科研的热度
最直接的切入点是把Claude这类模型接进你的数据处理流程。不用一上来就搞科研,先从你手头最烦的重复性任务开始:日志分析、配置排查、文档摘要、代码审查。用Claude Code这类工具把它脚本化,跑通一个最小闭环,再逐步扩展。
第二步是学一点计算神经科学的基础。不用深到能发论文,但至少要知道神经元模型、突触可塑性、连接组这些概念是什么意思。这样你看AI科研新闻时,能分辨哪些是真进展,哪些是包装。
第三步是找一个具体的小问题动手。比如下载果蝇连接组的一个子回路,用Brian2搭个仿真,看它能不能复现某个已知的振荡模式。这种小项目做下来,你对"神经网络到底怎么工作"的理解会比读十篇综述都深。
7.2 如果你是研究者,想用AI加速自己的领域
关键是把问题拆成模型擅长的部分和不擅长的部分。模型擅长的是:文献综合、假设生成、模式识别、代码实现。不擅长的是:严格形式化推导、物理约束下的优化、需要真实世界常识的判断。
把前者交给模型,后者自己把关。具体做法是:让模型生成候选方案,你用领域知识快速筛掉明显不合理的,再把剩下的做严格验证。这个"生成-筛选-验证"的循环,是目前AI辅助科研最有效的模式。
另外,保留完整的交互记录。模型给的每个建议、你做的每次筛选,都记下来。这些记录本身就是一份有价值的"人机协作日志",将来写方法部分或者做复盘都用得上。
7.3 如果你只是好奇,想看懂这类新闻
记住三个问题就够了:它解决了什么具体问题?证据是什么?边界条件是什么?任何一条AI科研新闻,能用这三问过一遍,基本就不会被带偏。
再补一个心态上的建议:AI科研进展确实快,但快不等于成熟。很多看起来惊艳的结果,过几个月会发现适用范围很窄,或者有没被发现的缺陷。保持关注,但别急着下结论。真正改变游戏规则的成果,通常经得起时间检验,不需要靠标题党来传播。
8. 我在实际跟踪这类进展时的一些个人习惯
最后分享几个我自己在用的习惯,没什么技术含量,但坚持下来对判断力的提升很有帮助。
第一个是建一个"存疑清单"。每次看到"突破""首次""颠覆"这类词,就把这条新闻记下来,标上日期和来源。过三个月回头看,哪些被后续工作证实了,哪些悄无声息了。这个清单积累久了,你对信息源的可靠度会有非常直观的感受。
第二个是优先读原始材料。新闻稿是二手信息,预印本和论文是一手。哪怕只读摘要和方法部分,也比读十篇新闻稿强。Claude这类工具在这里能帮大忙——把论文丢给它,让它用大白话解释方法部分,效率比硬啃高得多。
第三个是动手验证小结论。看到某个模型说"这个方法在XX任务上提升了Y%",如果代码开源,就拉下来跑一遍。跑不通或者结果对不上,本身就是重要信息。很多时候你会发现,论文里的"提升"依赖于非常特定的设置,换个数据集就没了。
第四个是保持对"不知道"的诚实。AI领域变化太快,没人能什么都懂。遇到不懂的就说不懂,然后去查。最怕的是用一堆术语把不懂的地方糊过去,那样骗的是自己。
这波从Claude推理突破到果蝇全脑上传的进展,我个人判断是方向对、节奏快、但离落地还有距离。值得认真跟踪,但不值得焦虑。工具在变强,会用工具的人也在变强,真正的差距在于谁能把工具用进真实的问题里。