腾讯混元团队在 7 月 21 日发布了 Hyra-1.0,这是首个专为性能导向研发与工程任务设计的智能体。框架遵循"The Bitter Lesson"哲学,把算力直接转化为回报:轻量级架构配合巨大的动作空间,通过通用循环不断自我改进。
核心架构由三个异步组件串联成流水线:上下文智能体负责维护经验库并生成“灵感”填入任务队列;提案智能体从队列取任务,在独立沙盒里生成并运行解决方案;系统整体作为异步流水线,随时间推移让资源利用率高效扩展。针对没有内置评估器的任务,Hyra 能升级为双层循环,让解决方案和评估机制共同进化,有效防止“奖励黑客”行为。
实测数据覆盖了 AI for AI、AI for Science 和 AI for Fun 三个领域。在 AI for AI 领域,Hyra 在三个基准测试中均超越了现有最佳记录:NanoChat Autoresearch 任务验证集 BPB 降至 0.9015;NanoGPT Speedrun 任务达到验证损失 3.28 所需时间缩短至 76.4 秒;SOL-ExecBench 任务联合优化 235 个 GPU 内核,平均 SOL 达到 0.771。
在 AI for Science 领域,Hyra 在数学难题破解上筛选了 55 个开放性问题,其中 29 个创下了新的历史记录。太阳黑子周期预测基于 1749-1932 年的月太阳黑子数据训练,发现的回归公式在近一个世纪“样本外”数据上 R² 值达到 0.77。架构设计方面,Hyra 设计了仅需 15 个可训练参数即可执行 10 位加法的 Transformer,将之前的公开记录减少了 58.3%;在 IBM Q20 上,其量子比特路由算法相比经典 SABRE 算法效率提升了 44.4%。药物研发中,针对抗癌靶点 PARP1 生成的候选分子,成药性评分显著高于市面上药物 Olaparib。
AI for Fun 领域展示了更直观的应用:在 Botzone 平台的 730 款参赛程序中,Hyra 的围棋程序排名第 3;它能根据单张 2D 参考图像生成可渲染的 3D 模型;基于旋律为各种乐器生成和声,经过 7 轮进化后输出色彩丰富的完整编曲。
腾讯混元团队表示上述成果仅为初步阶段,后续计划将 Hyra 集成到具体产品系统和真实研发管线,在工业场景中驱动“脚手架 – 数据 – 模型”的进化循环,并推动下一代混元大模型与该智能体持续共同进化。
