闻乐 发自 凹非寺

  量子位 | 公众号 QbitAI

  硅谷今年最贵的词,叫Recursive Self-Improving。

  它就是指让AI参与迭代自身的模型、算法、数据和研发流程。

  这个概念有多火呢?

  Jeff Dean离职创办的Discovery Loop,方向就是探索AI自动化科学研究。

  不只姐夫,AlphaGo缔造者David Silver等一众大牛也在同一条赛道上。

  看得出来,这些顶级AI研究者正在形成一个共识:

  让AI参与创造下一代AI,让AI持续自我改进并构建更强的AI。

  在这个共识之下,一个更棘手的问题出现了。

  模型越强,能给AI出题、解题、验证的人越少,高质量训练数据该从哪来?

  一支中国团队给出了他们的答案。

  由上海交大人工智能学院、深势科技、上海算法创新研究院组成的无尽前沿团队发布BigBang-V1——

  这是首个基于recursive self-improving原生方式训练出的基座模型。

  在训练过程中,出题、解题、验证都交给AI把控,通过可验证前沿任务持续生成高质量自演进合成数据,全程无需人类逐题参与。

  35B跑赢1T大模型

  模型已开源,技术报告也同步公开。

  BigBang-V1参数规模35B,推理时激活约3B参数,支持262K长上下文。

  它的后训练数据100%由AI自主合成,以科学前沿任务为核心。

  在这样的条件下,模型在长程搜索、代码、科学研究、AI研究等评测中,拿下全部35B模型里的10项第一。

  不仅如此,在FrontierScience Research、PaperBench等多项高难度科研任务上,成绩甚至超过了1T级的DeepSeek V4 Pro Preview。

  基准分数之外,具体任务里的表现更能说明BigBang-V1解决复杂问题的水平。

  先看一个高难度生物信息学任务。

  转座子定位要求在全基因组测序数据里定位一个47bp的转座子插入位点,模型不仅要识别相关序列,还得遵守RefSeq染色体命名和1-based坐标约定。

  BigBang没有去猜坐标,而是利用转座子与染色体之间的连接证据做约束映射:

  一个junction对应一个坐标,最终把断点锁定在4144431,每一步证据都可追溯。

  在论文复现任务里,BigBang的表现又像一个会自我纠错的工程师。

  任务要求把LBCS论文复现为可运行的代码仓库,它在通读完论文之后没有急着交卷,而是在冒烟测试里发现自己写出的实现违反了论文的核心主张:

  样本量被固定死了,核心集根本没法收缩。

  它推算了扰动规模,发现无法越过触发阈值,于是连续否决了三个候选修复方案,最终把连续扰动改成二进制掩码翻转,问题才真正解决。

  第二轮它又发现一个梯度项从计算图中脱离,主动恢复了梯度流,最终复现评分0.7657,全部485个评分点通过331个。

  这些案例体现的并不只是分数。

  BigBang真正展现出的是把多步证据组织成可验证结论的能力,以及在失败中发现问题、修正方案的本事。

  对科研AI来说,这两种能力恰恰最要紧。

  毕竟,科研不是背答案,而是从噪声里找证据,在出错时改方案。

  不过,以科研任务为核心构建的数据,并没有把BigBang-V1训练成只会答科学题的垂直模型。

  BrowseComp基准达到76.5,SWE-Bench Pro拿到54.2,能力增益同时迁移到了长程搜索、软件工程、代码等场景。

  我们也拿它实测了一把长程搜索。

  让它盘点8月第一周AI圈的大事。它一天一天连着检索了二十多轮、翻了十几个来源。

  先用定位候选事件,再逐条打开信源交叉验证,最后还专门找到一手页面核对细节,连发布日期都逐个确认才给出结论。

  而且它现搜列出的来源全部真实可访问。

  然后我们又让它写了一个太空射击小游戏。

  代码写得非常丝滑,打中后爆炸产生粒子特效,左上角还展示了分数、生命、等级游戏UI。

  100%纯AI合成的训练数据,为什么能有这样的表现?

  要解开这个疑问,得先从训练数据本身说起。

  训练数据生产,也可以成为AI优化对象

  Recursive Self-Improving火热,业界也都在谈论,但大多数探索还仅仅徘徊在概念层,真正跑通完整闭环的落地案例并不多。

  落到实际工作里,现在常见的有两类尝试。

  一部分方案只是给模型套上一层工具外壳,比如harness,让模型自己调调工具、改改提示词。

  但这样相当于只是把模型的调用方式做了增强,底层的训练管线几乎原封不动,并没有触动模型自我迭代的根源。

  还有一类做法则是用大模型对生成的数据做打分筛选。

  但这套评判标准是人类预先写死的规则,筛选逻辑本身不会跟着模型能力成长而自我演化。

  模型变强之后,旧的评判标尺很快就会失效,依然源源不断产出低价值样本。

  单纯靠扩大数据集规模、对已有数据反复清洗过滤,已经很难再撬动能力的进一步跃升。

  训练数据仍由人类逐题生产,模型的进化速度被人类出题的速度卡住,这是Recursive Self-Improving落地的核心问题之一。

  BigBang团队换了一个角度思考这个问题。

  如果模型可以自我改进,那么能不能让训练数据的生产系统本身,也成为被优化的对象?

  于是,问题从「如何收集更多科学数据」,变成了「如何让数据生产系统,随着模型能力一起持续进化」。

  要解决它,就要回到数据质量这一源头,数据质量不是清洗洗出来的,是任务本身的属性决定的。

  如果想要搭建一套能持续自我进化的数据系统,任务必须同时满足两个条件。

  首先是前沿性。

  任务要位于当前知识或模型能力的边界,甚至没有已知最优答案。

  新理论、新数据、新工具不断出现,科学前沿就会持续产生新问题,不会像静态题库一样被模型迅速耗尽。

  其次是可验证性。

  候选方案要能通过形式化方法、程序执行、数值计算、模拟器、实验反馈或领域工具做客观检查。

  只有前沿而无法验证,系统拿不到可靠训练信号;只有验证但缺乏难度,任务又会迅速落后于模型能力。

  二者缺一,数据都会快速贬值。

  BigBang团队将科学领域作为模型的训练载体,恰好同时满足前沿性与可验证性两大条件。

  它天然组合了搜索、阅读、提出假设、数学推导、代码开发、工具调用、实验分析和结果写作,相当于一套面向通用智能的综合课程。

  Jeff Dean说Discovery Loop这条路线适用于有可衡量目标的科学和工程领域,BigBang选科学当训练场,底层逻辑同源。

  用可验证的前沿任务牵引数据生产,让数据生产系统跟着模型一起进化,这就是BigBang给出的回答:

  AI advancing science, and science advancing AI.(AI推动科学,科学推动AI)

  AI开始决定,下一代AI学什么

  把理论答案落为工程实现,BigBang的关键是一套能持续修改和改进自身生产策略的自演化合成数据管线。

  它把RSI机制嵌入了训练管线内部,让AI直接参与任务构造、求解、验证、筛选,以及下一轮数据生产策略的优化。

  △BigBang整体框架

  系统的核心,是两类Agent协同工作。

  Generator Agent负责不断提出并解决科学、技术及AI研究中的高难度任务。

  并非照着固定Prompt出题的生成器,它是作为代码Agent,直接修改、运行和调试数据合成程序。

  并且,它还可以调整任务来自哪些科学领域、问题需要多长的推理链、该用搜索还是计算还是代码还是模拟工具,甚至决定哪些样本保留、哪些淘汰、哪些生成策略失败了下轮不再重复。

  每一轮实验结束,它还会记录修改动机、实验结果和失败原因,让后续探索继承此前的经验。

  Critic Agent则从对抗角度审查候选数据。

  第一层看格式、工具执行、数据完整性和约束满足;

  第二层进一步判断任务是否正确、可验证、足够困难、多样,并且真正具备训练价值。

  过不了审查的任务就被拒绝或回炉,通过的才进入合成数据集。

  Generator负责造,Critic负责挑,这套对抗与协作就像AlphaGo的自我对弈,只不过棋盘换成了开放的科学任务空间。

  以上是系统的自迭代内循环,但这种快速内循环还有一个隐患。

  Generator可能逐渐学会迎合Critic,造出一些表面复杂、评分很高、训练后却无法迁移到真实任务的数据。

  因此BigBang在快速循环之外,又加了一层由真实训练结果驱动的外循环。

  △BigBang的两层共同演化框架

  系统会生成不同版本的数据生产管线,分别训练模型,再放到留出的真实研究任务里评测。

  如果Critic认为某类数据价值很高,训练后的模型却没有真正变强,说明评价标准存在偏差,系统就用真实结果反向校准Critic,并调整Generator下一轮的任务领域和难度;

  反过来,如果某类看似狭窄的科学任务带来了搜索、推理或工具上的广泛提升,系统也会加大对该方向的探索。

  内外双循环转起来,数据和模型开始一起变强。

  但模型越强,原本困难的任务就可能“越来越不值钱”,所以模型过去无法处理的问题又变得可解。

  因此,数据管线必须是动态的,它得跟着模型一起变化。

  这就是BigBang的数据层RSI闭环:

  上一轮模型和实验产生的结果,影响下一轮训练数据的生成与筛选方式。

  100%纯AI合成数据,靠这个闭环打破了「合成数据会坍缩」的魔咒,错误的答案不会被当成正确答案继续喂回训练,因为验证链一直在兜底。

  当然,这也并不意味着人类退出研发。研发目标、资源预算、风险边界、最终验收标准,仍然由人类定义。

  AI不能自行修改评测标准,也不能因为自己的Critic打了高分就直接批准某个方案进入下一轮训练。

  人类负责确定方向和定义什么是有效进步,AI负责大规模探索、执行实验、整理失败经验、生产下一轮训练所需的数据。

  可以说,这是训练数据生产关系的一次重新分工。

  无尽前沿

  BigBang-V1背后的无尽前沿团队,是学术与产业的结合。

  团队创始成员之一是上海交大人工智能学院副教授陈思衡。

  这位CMU博士曾任职于Uber ATG自动驾驶部门,回国后带领团队打造出通用科研智能体SciMaster。

  SciMaster曾登顶OpenAI FrontierScience榜单,实现了“搜、读、算、做、写”完整科研闭环。

  另一位核心成员是上海交大助理教授张林峰。

  这位年轻博导主攻模型压缩与数据蒸馏,他提出的大模型数据蒸馏方法拿过CVPR满分,一直在探索怎么更科学地合成数据、怎么让模型用更少的数据变得更高效。

  产业一侧,深势科技创始人张林峰与中国科学院院士鄂维南为这支团队补上了AI for Science的产业纵深。

  无尽前沿要做的是依托可验证前沿任务的自进化合成体系,实现开放式通用智能,搭建完整AI自我迭代训练飞轮。

  当训练数据的生产不再依赖人类逐题产出、当AI开始参与决定下一代AI应该学习什么,AI进步的天花板,就被自己抬高了。

  或许,下一个赛点的关键不在算力堆叠,而在数据智能。

  模型主页:https://huggingface.co/endless-frontier/BigBang-v1

  代码地址:https://github.com/endless-frontier/BigBang-v1

  团队主页:https://endlessfrontier.tech