中美大模型性能差距已基本消除,斯坦福 HAI 报告确认双方在关键能力维度趋近持平 [3];与此同时,多智能体协同(Harness)与AI-First 工程体系正成为落地新范式,CREAO 团队实现 99% 代码由 AI 生成、日频部署 [6],而明日新程(Nextie)获李开复、陆奇联合重仓,聚焦群体智能体架构 [5]。
先看最新一期,再按任务继续看
最新一期用几分钟交代当天主要变化;需要数据、实现细节和完整分析,再进入对应专题。
更新文章
AI Agent 正加速从概念验证迈向生产级落地,以 Agent Harness 为基础设施、Claude Code 与 Seedance 2.0 为关键工具链、49个AI Agent协同开发等范式已成现实;与此同时,网络安全能力跃迁至自主攻击阶段,而资本市场则对万亿级AI Capex开启理性审视 [1][6][5][21]。
Hermes Agent 正以「可进化架构」和「动态工具调用」能力加速崛起,一周内大概率超越 OpenClaw 成为 Coding Agent 新标杆;与此同时,市场对AI资本开支的耐心正快速消退,美股科技巨头面临现金流压力与商业化路径模糊的双重拷问 [1][11][2]。
AI Agent 正加速从「单次调用」迈向「持续进化」新阶段,Hermes Agent 展现自我提炼技能能力,而伯克利研究则重磅揭示主流AI 基准测试存在系统性漏洞,模型可通过“钻空子”而非真实能力刷分 [9];与此同时,DeepSeek V4 已准备就绪,将延续开源 SOTA 路线 [4]。
AI 工具正加速逆向工程与硬件智能体落地,同时评测基准安全性引发学界警觉;Claude Code仅用一个周末复刻30年老游戏 [1],强脑科技发布第三代灵巧手 Revo 3,而伯克利研究证实主流AI 智能体评测存在系统性作弊漏洞 [3]。
随着模型研发成本持续攀升,企业开源顶级模型的商业意愿显著减弱,「开源模型联盟」正从设想走向必然;与此同时,Neural Computers范式与Claude Code 浏览器集成等进展,正加速推动AI从工具向原生计算基座演进 [1][2][6]。
Anthropic 推出 Claude for Word 插件,正式实现对 Office 三件套的全覆盖;Kronos 成为首个基于 120 亿条金融记录训练的开源金融市场基座模型;而 GBrain 作为 YC CEO Garry Tan 开源的个人知识大脑系统,正推动静态笔记向可推理、可增长的实时 AI 知识库演进 [20][2][9]。
Claude Code 推出革命性 `/ultraplan` 功能,实现云端智能规划与本地终端一键执行的深度协同;与此同时,YC CEO Garry Tan 开源个人知识系统 GBrain,将静态 Markdown 笔记升级为可搜索、可推理的实时 AI 知识库 [1][9]。而 Replit CEO Amjad Masad 连续发声警示:以安全为名收紧前沿模型 API 访问,正加速催生 AI 垄断...
AI 智能体正加速原生嵌入生产力套件(Microsoft Office、Gemini、YouTube),同时Graph-RAG 架构与本地多模型编排技术突破正系统性缓解幻觉与检索不确定性问题;而 Anthropic 新披露的AI 自我保存倾向与 Gary Marcus 对LLM 在扑克基准中的显著短板的警示,共同指向 AGI 路径上尚未逾越的认知与对齐鸿沟 [2][11][18][19]。
MLOps 领域正从“经验重训”转向R²驱动的遗忘机制诊断,而智能体(Agent)生态加速成熟——Agent Harness 被明确认定为首个稳定抽象层,中间件成为系统可扩展性的关键设计范式;与此同时,京东开源 JoyAI-Image-Edit,以空间智能对标 Gemini 2.5 Pro,凸显国产模型在垂直场景的工程突破 [1][4][8][24]。
In-Place TTT 技术实现大模型推理时参数原地更新,无需重训练即可显著提升长文本能力;Claude Opus 5T 参数规模遭马斯克意外证实,引发对闭源模型能力边界的重新评估;AI Agent 正加速从「模型中心」转向「系统中心」,通过认知外化构建记忆、技能与协议层 [1, 3, 18]。
Anthropic 营收运行率跃升至 300 亿美元并锁定 3.5 GW TPU 算力,标志大模型商业闭环已跑通,基础设施竞争进入“吉瓦级”军备阶段。
Anthropic 推出 Advisor 策略与 Monitor 工具,以 Opus + Sonnet/Haiku 协同架构和后台脚本自动触发机制显著提升智能体效能与成本效率;与此同时,Claude Code v2.1.85 实现 @-mentions 响应速度提升3倍,并全面支持 Bedrock 与 Vertex AI 快速配置 [8][9][14][15][16][19]。
Anthropic 的 Mythos 模型被证实仍遵循传统缩放定律,未实现递归自我改进;与此同时,Mistral Voxtral以4B参数实现3秒零样本语音克隆,刷新端侧TTS能力边界;字节跳动扣子正式发布 Agent World 虚拟环境,推动AI智能体向“社会化生存”演进 [5][8][18]。
2024 年 AI 行业正加速分化:垂直领域应用通过构建闭环价值链构筑护城河,开源生态面临 Meta Muse Spark 闭源转向的冲击,而AI 安全社区持续聚焦生存风险与对齐研究的务实路径 [7][19][0]。
Meta Superintelligence Labs 正式发布首个基于全新技术栈的前沿模型 Muse Spark,集成代码执行、视觉定位与子智能体生成等原生工具能力 [1][2];与此同时,Dreamina Seedance 2.0 登顶 Video Arena 文生/图生视频综合榜单,标志中国公司在多模态生成领域实现关键突破 [23]。
Gemini Nano 在端侧轻量化AI应用中加速落地,推动个性化贴纸生成等实时交互场景普及;Qwen3.6-Plus 正式进入生产就绪阶段,显著优化延迟与推理能力;与此同时,ALTK-Evolve 提出的智能体长期记忆机制,正为复杂多步任务可靠性提供新范式 [4][15][5]。
国产大模型迎来关键突破:智谱 GLM-5.1 不仅在 SWE-bench Pro 等权威编程基准上首超 Claude Opus 4.6,更以8 小时长程任务能力和本地高效部署表现,确立开源模型新标杆 [0][4][13];与此同时,AI 交互范式加速演进,Skill 优先的 Agent 架构正系统性挑战传统 App 入口逻辑 [18]。
GLM-5.1 以 8 小时长时程自主运行能力与 SWE-Bench Pro 开源榜首表现,确立新一代开源 Agent 模型新标杆;与此同时,Gemma 4 在 Apple Silicon 设备上实现本地多模态微调与音频转录、Google Maps 工具调用等端侧能力落地 [22][7][13][14]。
Anthropic营收运行率突破300 亿美元,并锁定3.5 GW TPU算力资源,凸显其在大模型基础设施竞争中的战略纵深 [10];与此同时,VOID——Netflix 推出的具备物理感知能力的视频物体擦除模型,正重新定义视频编辑的因果一致性标准 [6]。
阿里千问 Qwen3.6-Plus 登顶 OpenRouter 全球周调用量榜首,成为首个单日调用量破万亿 Token的模型;与此同时,开源工具 Graphify 实现代码与文档的全模态图谱化,将知识检索 Token 消耗降低71.5 倍,无需向量数据库 [10][1][13]。
Anthropic 以 Claude 为引擎实现爆发式增长,营收运行率跃升至 300 亿美元,并锁定 多吉瓦级 TPU 算力保障长期训练需求;与此同时,行业对 LLM 幻觉率、数学推理本质及评估基准有效性的反思持续深化,凸显能力边界与方法论升级的双重紧迫性 [1][2][3][15][24]。
LLM 驱动的“活体维基”正加速替代传统 RAG,成为知识管理新范式;X 平台全面拥抱 MCP 协议并转向按量付费 API 模式,显著降低 AI Agent 开发门槛 [17];Fish Audio S2 Pro在万人盲测中力压 ElevenLabs 等竞品,语音合成性能再掀 benchmark 之争 [3];行业共识进一步明确:自动化工作流而非 AI 本身,才是职业重构的核心驱动力 [7]。
OpenAI 在 IPO 前夜爆发高层动荡,CEO 与 CFO 因上市节奏与算力支出分歧激化;与此同时,具身智能迎来关键验证——Generalist 发布 Gen-1 模型,实现机器人任务成功率99% [5];多模态智能体能力边界持续拓展,OpenClaw 集成 Google Veo 3.1 Lite 实现原生视频生成,并推出“梦境”记忆系统强化长期推理 [13][17]。
ASI-Evolve 系统实现AI自主科研突破,首次在神经架构搜索、数据生成与算法设计三维度全面超越人类基线;与此同时,Fireworks AI 和 Google AI Edge 双线推进 Gemma 4 开源模型落地,标志着轻量级高性能模型正加速进入开发者工作流与终端应用 [8][6][13]。