AI开始自己出题进化,电商卖家看懂数据层RSI少踩坑
「核心速览」
- BigBang-V1:首个RSI原生训练基座模型,35B参数、推理激活约3B
- 后训练数据100%由AI自主合成,35B模型评测拿下10项第一
- 机制:Generator出题 + Critic验证 + 内外双循环共同演化
- 对卖家:AI工具将加速自我进化,选型关键看「可验证性」
- 人类仍掌控方向与验收标准,AI负责大规模探索与生产数据
一、事件背景:AI为什么开始「自己出题」
硅谷今年最贵的词,叫 Recursive Self-Improving(RSI)——让AI参与迭代自身的模型、算法、数据和研发流程。
顶级AI研究者正在形成共识:让AI参与创造下一代AI,让AI持续自我改进并构建更强的AI。
- Jeff Dean 离职创办的 Discovery Loop,方向是探索AI自动化科学研究;
- AlphaGo缔造者 David Silver 等一众大牛,也在同一条赛道上。
但共识之下,一个更棘手的问题浮出水面:模型越强,能给AI出题、解题、验证的人越少,高质量训练数据该从哪来?
答案藏在数据层:如果AI能自己生产、验证训练数据,进化天花板就被自己抬高。
二、关键信息:35B的BigBang-V1凭什么跑赢1T大模型
模型与团队
由 上海交大人工智能学院、深势科技、上海算法创新研究院 组成的 无尽前沿团队 发布 BigBang-V1——首个基于recursive self-improving原生方式训练出的基座模型。
- 参数规模 35B,推理时激活约 3B 参数,支持 262K 长上下文;
- 后训练数据 100%由AI自主合成,以科学前沿任务为核心;
- 模型已开源,技术报告同步公开(HuggingFace / GitHub)。
硬核评测数据
在长程搜索、代码、科学研究、AI研究等评测中,BigBang-V1拿下 全部35B模型里的10项第一。
更关键的是,在 FrontierScience Research、PaperBench 等多项高难度科研任务上,成绩甚至超过 1T级 DeepSeek V4 Pro Preview。
- BrowseComp 基准达到 76.5;
- SWE-Bench Pro 拿到 54.2;
- 能力增益同时迁移到长程搜索、软件工程、代码等场景。
「以科研任务为核心构建的数据,并没有把BigBang-V1训练成只会答科学题的垂直模型。」——量子位报道原文
两个具体案例
案例一:转座子定位。要求在全基因组测序数据里定位一个 47bp 的转座子插入位点,BigBang利用转座子与染色体之间的连接证据做约束映射,最终把断点锁定在 4144431,每一步证据都可追溯。
案例二:LBCS论文复现。模型通读论文后在冒烟测试中发现自己写出的实现违反核心主张,连续否决了三个候选修复方案,最终把连续扰动改成二进制掩码翻转,复现评分 0.7657,485个评分点通过331个。
三、机制拆解:数据生产系统如何跟着模型一起进化
现有两条路的局限
业界谈论RSI的多,但真正跑通完整闭环的落地案例并不多。落到实际工作里,常见两类尝试,都没触及根源:
| 方案 | 机制 | 局限 |
|---|---|---|
| 工具外壳(harness) | 让模型自己调工具、改提示词 | 只增强调用方式,底层训练管线几乎原封不动 |
| 大模型打分筛选 | 用大模型对生成的数据打分 | 评判标准是人类写死的规则,不随模型能力演化 |
| 数据层RSI(BigBang) | 数据生产系统本身成为被优化对象 | 内外双循环共同演化,验证链兜底防坍缩 |
核心结论:训练数据仍由人类逐题生产,模型的进化速度被人类出题的速度卡住,这是RSI落地的核心问题之一。
任务需同时满足两个条件
- 前沿性:位于当前知识或模型能力边界,甚至没有已知最优答案,科学前沿会持续产生新问题;
- 可验证性:候选方案能通过形式化方法、程序执行、数值计算、模拟器、实验反馈做客观检查。
只有前沿而无法验证,系统拿不到可靠训练信号;只有验证而缺乏难度,任务会迅速落后于模型能力。二者缺一,数据都会快速贬值。
两类Agent + 内外双循环
系统的核心是两类Agent协同工作:
- Generator Agent:作为代码Agent,直接修改、运行和调试数据合成程序,决定任务领域、推理链长度、该用搜索还是计算还是代码,甚至决定哪些样本保留、哪些淘汰;
- Critic Agent:从对抗角度审查,第一层查格式、工具执行、数据完整性和约束满足,第二层判断任务是否正确、可验证、足够困难且多样。
Generator负责造、Critic负责挑,这套对抗与协作就像 AlphaGo的自我对弈,只不过棋盘换成了开放的科学任务空间。
为防止Generator迎合Critic、造出「表面高分却无法迁移」的数据,BigBang又加了由 真实训练结果驱动的外循环:生成不同版本的数据管线分别训练模型,再放到留出的真实研究任务里评测,用真实结果反向校准Critic、调整Generator下一轮方向。
「上一轮模型和实验产生的结果,影响下一轮训练数据的生成与筛选方式。」
当然,人类并未退出:研发目标、资源预算、风险边界、最终验收标准,仍由人类定义,AI不能自行修改评测标准。
四、对电商卖家:机会、风险与避坑
机会一:AI工具将加速自我进化
当训练数据不再依赖人类逐题生产,AI进步的天花板被抬高。对卖家的直接信号是:客服、素材、选品、广告投放等AI工具的迭代速度会更快,此前「AI不好用」的体验可能快速改善。
机会二:算力成本有望下探
35B跑赢1T大模型、推理仅激活约 3B 参数,意味着「小模型干大活」成为可能,AI推理与调用成本存在下降空间,卖家的AI采购成本或受益。
风险一:「可验证性」边界决定红利不均
科研任务天然可验证,但电商里大量核心任务——审美、文案调性、选品直觉——难以客观量化验证,AI自我进化的红利不会均匀落到每个环节。
风险二:警惕「100%AI合成」的夸大宣传
BigBang能打破「合成数据会坍缩」的魔咒,靠的是验证链兜底。卖家选型时若遇到号称「全AI数据」的工具,务必追问:数据如何验证?错误答案会不会被当成正确答案喂回去?
风险三:评测分数不等于电商场景
FrontierScience、PaperBench是科研导向评测,与电商场景差异巨大。卖家不应因「35B跑赢1T」就认定该技术路线能立刻解决选品或客服问题,能力迁移有边界。
五、落地建议:卖家现在就能做的几件事
- 选工具看「验证机制」:优先选能自查、能交叉验证、能追溯每一步依据的AI工具,而不是只会给结论的。
- 给AI派「可验证」的活:广告投放、库存预测、价格监控、数据分析等能用数字检验的任务,AI自我进化红利最先兑现;审美、文案类任务保留人工把关。
- 沉淀自己的数据资产:客服对话、转化数据、素材AB测试结果都是「可验证任务」的来源——数据生产系统正在成为被优化的对象,数据即壁垒。
- 关注开源模型与成本变化:BigBang-V1已开源(HuggingFace/GitHub),卖家与技术方应跟踪其代码、搜索、工具调用等能力迁移,重新评估自建或接入的性价比。
- 关键决策保留人工复核:人类定义方向与验收标准的原则同样适用于卖家——AI负责探索与执行,风险边界与最终验收由人拍板。
参考来源:量子位(https://www.qbitai.com/2026/08/468782.html)
评论(0)