770B 不重要:Hy4 preview 真正的变化是,它开始参与训练自己

AI资讯2周前发布 craved
580 00

通稿里被淹没的那段话

8月28日,腾讯混元发布并开源了Hy4 preview。大部分报道的标题都差不多:770B总参数、49B激活、1M上下文、稳居开源第一梯队、盲测略优于GLM 5.3和Kimi K3。这些都没错,但都是常规升级——把295B/21B/256K的Hy3放大到770B/49B/1M,本来就是大家预期内的动作。真正值得关注的是官方通稿靠后的一段,话说得很平实,几乎没媒体单独拎出来讲:

Hy4 preview在自身研发的全链路过程中发挥了积极价值,首次参与训练方法、数据策略、评估体系和底层算子的自动优化。模型提出方案、运行实验并根据结果继续迭代,实验产生的代码、日志和反馈进入下一轮探索,形成初步的递归自我改进闭环。翻译一下:这个模型参与了造自己的过程。它还给出了一个能验证的数字:模型自主分析推理系统的瓶颈,围绕算子融合、通信优化做了多轮优化,端到端吞吐比基线提升31.8%。这篇文章说三件事:这段话说的是啥、它在行业里啥位置、有多少水分。

一、先厘清:它到底改进了啥

官方列了四个改进对象:训练方法、数据策略、评估体系、底层算子。前三项属于模型研发流程,第四项属于推理工程。这里得先做个关键区分,不然容易被“自我改进”四个字带偏:Hy4 preview做的是“有限度的自我改进”。它改的是围绕模型本身的那套东西——实验脚本、训练配方、数据筛选规则、算子实现,不是自己重写自己的权重。这两者的差距,相当于“工程师优化自己的工具链”和“生物改写自己的基因”那么大。学术界有个现成的参考框架:石溪大学团队2026年发了一份113页的综述,梳理了500多项相关研究,把自我改进拆成四步闭环:

  1. 拿数据
  2. 筛数据
  3. 优化模型
  4. 精调推理外面再包一层“自主评估层”,一直检验“改的东西是不是真的有用”。对照这个框架看Hy4 preview:训练方法和数据策略对应第2、3步,算子优化对应第4步,评估体系就是最外层的评估层。三层同时动起来,闭环才成立——只动一层,那叫自动化脚本,算不上自我改进。

为什么是混元先跑通

这不是偶然。2026年初,混元做了一次内部叫“四重建”的动作:预训练重建、强化学习重建、数据体系重建、评估体系重建。主导的是腾讯首席AI科学家姚顺雨——清华姚班出身、普林斯顿博士,ReAct框架和思维树的提出者,之前在OpenAI参与过Operator和Deep Research项目。他2025年下半年加盟腾讯,年底出任CEO/总裁办公室首席AI科学家,同时管AI Infra部和大语言模型部;2026年3月腾讯撤销成立十年的AI Lab,所有研发力量都并入混元主线。“四重建”的核心是从“分数驱动”转向“场景驱动”:弱化公开榜单的权重,建立基于真实业务任务、高质量人工反馈和产品实际体验的评估闭环,团队自己建了50多个评测基准。这套评估基础设施,就是今天“递归自我改进”能成立的前提。没有靠谱的裁判,模型自我迭代就只是自己哄自己。 换句话说,年初那次重建评估体系,昨天才第一次收到利息。还有个容易忽略的时间点:2026年7月21日,混元已经推出过Hyra-1.0,官方描述是“能够递归自我改进、专为性能导向的研究与工程任务打造的智能体”。先做出来能递归自我改进的Agent,五周后把它用在自己身上。这条时间线,比单看8月28日的通稿清楚得多。


二、横向看:2026是自我改进元年

把视野拉开,会发现腾讯不是独一份,甚至不是跑在最前面的。OpenAI。 2026年7月发布GPT-5.6(分Sol/Terra/Luna三档)时,同步推出了个叫RSI Index(递归自我改进指数)的指标,用“调试研究系统、优化训练配方、改进其他模型”这类内部AI研究任务打分。GPT-5.6 Sol在这个指数上比GPT-5.5高16.2分。有个公开演示的案例:Sol只凭一条说不清楚的指令,自主选训练配置、挑GPU、跑完post-training,产出了更小的Luna档位——OpenAI估算,这事原本得两位高级研究员多花两周。Anthropic。 截至2026年5月,Anthropic代码库里超过80%的代码是Claude写的。还有个更典型的实验:给Claude驱动的agents一个开放的安全研究问题,让它们自己提假设、测试、迭代。两位人类研究员花一周恢复了约23%的既定benchmark差距;agents用了800累计小时、约18000美元算力,恢复了约97%。人类只管选题和定评分标准,实验设计和迭代全自主。Google DeepMind。 AlphaEvolve走的是另一条路——不写代码,而是用演化算法:生成方案、按目标打分、对最优版本变异,已经在数据中心调度和矩阵乘法算法上找到过真实的改进。学术界。 alphaXiv的统计显示,递归改进相关论文已经到1250篇左右,其中四分之三都是2026年发的。所以,对Hy4 preview更准的定位是:跟进并落地,不是首创。 但它是国内第一个把这条链路正式写进旗舰模型发布通稿的——这个动作本身有信号价值,说明这条路线已经被当成核心能力,而不是实验室里的边角料。


三、冷静看:三个不能忽略的点

1. 盲测的0.07分,得打折看

官方数据:163名专家、203个工程任务,4分制盲测,Hy4 preview得2.99,GLM 5.3得2.92,Kimi K3得2.94。差距只有0.05到0.07分,折算下来约1.75%。203个任务的样本量下,官方没给置信区间或者显著性检验,所以“略优于”这个结论的靠谱程度存疑。另外要注意,这163名是腾讯内部专家,不是第三方机构,主场优势没法排除。这不是要否定成绩,而是要指出个更值得关注的信号:国产第一梯队已经进入贴身缠斗阶段。0.07分的差距,说明头部模型之间的差距已经缩小到误差范围里了,接下来比的不再是跑分,而是场景贴合度和成本。

2. 31.8%是吞吐,不是智能

这个数字在传播里最容易被误解。它衡量的是推理系统吞吐,不是模型本身的能力。但恰恰是这一点让它更可信:吞吐是用秒表和显存就能硬测出来的,没有解释空间,也不存在刷分的问题。它的真实商业意义更值得看:Hy4 preview的定价走普惠路线,输入6元/百万tokens、输出18元/百万tokens、缓存命中0.3元/百万tokens。这个价格能立住,背后靠的就是这31.8%的工程优化。能力决定上限,成本决定能不能普及。

3. 这条路真正的天花板,是裁判本身

递归自我改进最大的风险,从来不是“模型太强”,而是评估器没用。行业里已经公认的头号风险是评估器脆弱:一旦评估器不够强,刷分会搞出自我确认的死循环——模型说服自己“这个改动是好的”,指标在涨,实际能力没动。2026年7月arXiv上的一篇综述(2607.07663)里总结得很到位:

自我生成的信号越“特权化”,这个闭环就越高效地同时传递能力和偏见。还有条被反复验证的负面结果:自我训练会继承基座的固有局限——多跑几轮循环,修不了架构本身学不会的东西。把这两条放回Hy4 preview的语境:它的评估体系是自家重建的,盲测专家是自家的,改进方案是自己提的。裁判、运动员、规则制定者都在同一个场地里。 这不代表结论不可信,但它划定了这条路线的天花板——闭环能跑多远,取决于评估器比模型强多少。顺带说个工程现实:有统计显示,形式化验证只能抓到agent输出里约65%的缺陷,而验证成本已经占到实验总预算的20%到40%。自我改进听起来省人力,实际上把成本转移到了评估侧。

4. 现在下结论还太早

官方自己承认这是早期版本——“预训练和后训练均仍有较大的提升空间”,Hy4下一版近期就会上线。参照Hy3的preview到正式版的轨迹:幻觉率从12.5%降到5.4%,常识错误率从25.4%降到12.7%,降幅约50%。如果这个规律在Hy4上重演,正式版可能还有一轮不小的提升。所以本文讨论的是preview阶段的观察,不构成对Hy4最终能力的判断。


四、怎么用:给实际干活的人

入口。 WorkBuddy / CodeBuddy国内版及国际版、元宝、ima已经同步首发;API可以通过腾讯云TokenHub和OpenRouter接入。WorkBuddy / CodeBuddy目前有为期两周的限时免费关于“开源第一梯队”的现实。 Hy4 preview采用Apache 2.0协议开源,架构细节公开:78层(第1层dense FFN,其余77层MoE),每层256路由专家+1共享专家,每token激活top-8路由+1共享,hidden size 6144,词表120832。(Hugging Face页面显示780B,是算上了内置的MTP投机解码层。)但770B的部署门槛是真实的。对绝大多数人和团队来说,“开源”的意义在于可研究、可微调、可私有化,不是自己扛得起推理。真正能用上的路径还是API。建议。 别急着把它换成主力模型。preview期最有价值的用法,是把它丢到你手上最脏最累的那个长程任务上——几十份杂乱文件的交叉稽核、一个你不敢动的老代码库重构、一次跨文档的财务核对。这类任务正好落在它宣传的“办公分析”和“长程开发”区间,而且你自己有判断标准,不用依赖别人的跑分。看它在你自己的场景里掉不掉链子,比看那12项benchmark有用得多。


结尾:一个可观察的指标

过去两年,行业的公式是:更多数据 + 更多算力 + 更多人力反馈。现在,第三项开始被自动化了。Hy4 preview的770B会过时,1M上下文会被超越,0.07分的盲测优势下周可能就反转。但“模型参与自己的研发”这件事,一旦跑通就不会退回去——因为它改变的不是模型的高度,而是模型攀爬的速度由谁决定。最后留个可观察的指标:下一版Hy4会不会披露“模型参与自身研发”的贡献占比。如果会,并且给出量化口径,那才是真闭环;如果不再提,那这次更可能只是一次漂亮的工程优化。我们两周后见分晓。


关于本文
  • 写作日期:2026年8月29日,基于Hy4 preview公开发布信息(发布日8月28日)
  • 本文讨论对象为preview版本,结论不具备对Hy4正式版的预测效力
  • 所有引用数据均来自腾讯官方发布、人民网、腾讯新闻及公开学术资料,未做独立benchmark复现
  • 盲测数据(163名专家/203个任务)为腾讯内部评测,非第三方机构结果

© 版权声明

暂无评论

none
暂无评论...