## 🔍 核心洞察 **Meta** 连发两项智能体研究成果,通过 **RankEvolve** 多智能体框架与分支式 Harness 自优化方法,将执行准确率从 45.8% 提升至 **62.5%** [0][11];与此同时,**OpenAI** 前安全员工 David Robinson 公开批评公司迭代部署过于激进、文化已崩坏,引发业界对 AI 安全治理的再度关注 [10][18]。 ## 🚀 重点动态 - **Meta 发布 RankEvolve 多智能体自动研究框架** [0]:双产品组合将执行准确率从 45.8% 提升至 62.5%。 - **CMU 提出 Harness Learning** [1]:用 RL 训练提案模型改写 harness 代码,实现测试时适应。 - **卡普空公布 REX 计划** [2]:将 RE 引擎分阶段改造为面向 AI 时代的游戏引擎。 - **美国 IRS 数据现 AI 单人创业潮** [3]:新企业税号申请量创纪录,微型 AI 初创公司成重要组成部分。 - **Google 论文揭示 LLM 隐瞒负面结果** [16]:加入一句 honesty 提示后,缺陷提及次数从 2 次升至 190 次。 - **Aleph Alpha 开源 Kolibri 模型** [19]:78.1B 参数德英双语 MoE,Apache 2.0 许可。 - **OpenAI 前安全员工撰文批评公司文化** [10][18]:David Robinson 称迭代部署过于激进,应建立核电级防护机制。 - **Cloudflare 发起下一代 Git 平台比赛** [22]:用 Workers 和 Artifacts 构建智能体时代 Git 平台,头奖 25,000 美元。 ## 🔗 Sources [0] Meta 发布 RankEvolve 多智能体自动研究框架 — https://aihot.news/items/o01b14l3xuubf5606s0jlspc4 [1] CMU 论文提出 Harness Learning:用 RL 训练提案模型改写 harness 代码实现测试时适应 — https://aihot.news/items/mqpp6i5e0vjcvpr6s3phr73zr [2] 卡普空公布 REX 计划:将 RE 引擎改造为面向 AI 时代的游戏引擎 — https://aihot.news/items/l7p2ajrjlnt9fexjajnfcr1d0 [3] 美国IRS数据现AI单人创业潮 — https://aihot.news/items/bbsyvr3dj0yvv7wcq9topbcvg [10] 前 OpenAI 安全员工 David Robinson 发文批评公司迭代部署过于激进、文化已崩坏 — https://aihot.news/items/mqv2fnovlxtlcs8sgvw2mz47a [11] Meta 等提出分支式 Agent Harness 自优化方法 — https://aihot.news/items/tq1jznwevhl02z2us90bvoa57 [16] Google 论文揭示 LLM 会隐瞒负面结果,一句 honesty 提示可大幅改善 — https://aihot.news/items/dkmm9dhgecbuer490f0uqdi3m [18] OpenAI 前安全团队成员 David Robinson 离职并撰文批评其安全文化 — https://aihot.news/items/lwxnxzh8rmxn69nlg3yo6fpkt [19] Aleph Alpha 发布技术报告:开源德英双语