8 月 27 日,腾讯混元(Hunyuan)发布 Hy4 preview——新一代旗舰开源模型:总参数 770B激活参数 49B上下文长度 1M,在代码、办公、科学等真实生产力任务上展现出卓越能力。

新一代旗舰模型

Hy4 preview 在模型尺寸、上下文长度、数据规模上都进行了显著扩展,预训练和后训练的共同进步带来智能水平的又一次巨大提升,稳居开源模型第一梯队。

Hy4 preview 基准评测

为生产力而生

通过与腾讯内部软工、游戏、金融、安全等领域顶尖专家的高质量数据共建,Hy4 preview 在各类真实生产力任务上取得显著进步:

软件工程

增强长程开发任务的理解、规划、调试与验证能力,进一步提升前端开发的视觉审美和交互质量。官方演示了三个典型场景:用一句需求生成完整可交互的「国家古建筑 3D 数字卷宗」(七座古建筑 GLB 模型的三栏卷宗式 3D 浏览)、用 React + Three.js 制作中英双语互动漫画网页《鹅来》,以及程序化生成带完整昼夜循环的 3D 微缩景观。

办公分析

显著提升复杂办公环境理解和金融分析能力,着重优化数据分析、跨文件协作,完成从信息处理到文档、表格与演示文稿交付的完整流程。演示案例包括:财务共享中心的 24 张报销单费用稽核(交叉比对制度文件、花名册、预算与台账后给出逐单结论与核减额),「金融世界沙盘」网页 Demo(改变一个现实变量,观察影响沿产业链传播并汇聚到公司估值)。

游戏开发

增强「一句需求直接生成可玩原型」能力,并熟练使用游戏引擎,开发者可通过多轮交互持续完善复杂游戏项目。演示覆盖:Unity 第三人称 3D 企鹅冒险游戏、Unreal 黄昏森林尸潮 FPS、一句话生成的 3D 密室逃脱、Godot 卡牌构筑肉鸽游戏《CardRogue》(参考《杀戮尖塔》但内容原创)、手绘绘本风单文件生存肉鸽等——每项都是从零自主实现完整可玩原型。

科学研究

显著提升复杂科研问题的理解、推理与求解能力,模型在 AI 研发、分子动力学模拟、凝聚态物理、基础数学等各类场景中均有长足进步:

  • 科研 Agent 化:Hy4 preview 可以像研究者一样管理多个 Codex Session 开展实验,并根据结果持续调整探索方向。在小模型后训练任务中,它作为 researcher 协调 Codex 同时优化多个评测目标,8 项评测上均优于 Codex 独立探索

  • 推理系统优化:Hy4 preview 自主分析推理系统瓶颈,围绕算子融合、通信优化等方向开展多轮优化,端到端吞吐相较基线提升 31.8%,在不同上下文长度和并发度下均取得稳定收益。

  • 分子动力学:配合 Hyra,Hy4 preview 在机器学习力场分子动力学(MD)模拟上取得进步,32,512 原子磷脂双分子层 SO3LR 在高度优化的 JAX 实现上进一步提速 2.0×,达到 54.9 ms/step,单卡 H20 可容纳 30 万原子

    SO3LR 磷脂双分子层分子动力学模拟

  • 凝聚态物理:面向低温量子输运器件设计问题,Hy4 preview 自主完成量子散射求解器构建、五势垒结构稳健优化和独立含时演化验证,将高能阻带平均泄漏率从基线的 48.2% 降至 4.8%,并自动生成支持调参与重新求解的交互式模拟器。

    低温量子输运器件中电子波包的含时演化模拟

  • 百年几何难题:配合 Hyra,Hy4 preview 在三维 Blaschke–Lebesgue 问题上取得重大突破,将体积下界从 0.380799 推进至 0.41104;相较于 Meissner 四面体猜想给出的 0.41986,让该猜想距最终证明只剩最后 2% 的 gap。

    三维 Blaschke–Lebesgue 问题的体积下界突破

真实用户盲测与产品协同

同时,Hy4 preview 持续与 CodeBuddy / WorkBuddy 等产品深度协同,优化生产力场景的真实用户体验。腾讯组织了 163 名内部专家进行 203 个工程任务的盲测,结果显示 Hy4 preview(均分 2.99/4)略优于 GLM 5.3(均分 2.92/4.00;胜 46.8% / 平 12.8% / 负 40.4%)和 Kimi K3(均分 2.94/4.00;胜 51.2% / 平 7.9% / 负 40.9%)。

Hy4 preview 现已开源,在腾讯云OpenRouter 上线,并可在 CodeBuddy / WorkBuddy、元宝、ima 等产品上体验。

Hy4 preview API 价格(每百万 Token):

输入(命中缓存)输入(未命中)输出
0.3 元6 元18 元

迭代与展望

Hy4 preview 是 Hy4 迭代的一个早期版本,预训练和后训练均仍有较大提升空间,也有一些已知问题,如复杂任务的长思考和过度自我验证倾向,腾讯将持续敏捷迭代。如同 Hy3 preview,腾讯希望通过 Hy4 preview 的尽快发布获得广泛的真实反馈,从而显著提升 Hy4 正式版,并坚持发挥与腾讯产品和专家深度合作的独特优势,持续提升生产力的普惠性和上限。

附录:模型得分

Hy4 preview 模型得分图表

原文:Hy4 preview 发布(腾讯混元,2026-08-27)

模型资源:GitHub · Hugging Face · ModelScope