中国AI产业正加速进入多智能体协同与端云融合落地新阶段,支付宝AHA协议、哈工大GUI Agent、B站updream预演台等成果密集涌现;与此同时,AI硬件需求驱动存储芯片业绩爆发,普冉股份上半年净利润同比激增1929% [17],而大模型商业化路径亦从“卖触达”转向“卖结果”[2]。
先看最新一期,再按任务继续看
最新一期用几分钟交代当天主要变化;需要数据、实现细节和完整分析,再进入对应专题。
更新文章
中国AI产业正加速从技术验证期迈入商业兑现期:百度Q2 AI收入达125亿元,占其一般性业务超半壁江山 [5];支付宝发布AHA多智能体跨端互联协议,推动智能体从「卖触达」向「卖结果」范式跃迁 [2];与此同时,开源文档解析工具AnyDoc与内化知识优先论等底层认知分歧,正重塑模型能力评估标准 [3][4]。
Anthropic 为Claude全量输出强制添加统计水印,被指违反欧盟AI法案适用范围且误伤创作者场景 [1];与此同时,DeepSeek Harness插件生态爆发式增长,用户已将其拓展为支持多 Agent 调度与UI 主题定制的“赛博乐高”平台 [2]。
AI 智能体正从概念验证加速迈向工程化落地与商业化闭环,DeepSeek Harness 的「一切皆插件」架构、Cursor Origin 的智能体原生代码托管平台、以及阿里 RealReplicaBench 揭示的 Agent 评测范式革命,共同指向一个关键转折:Agent 不再是“会聊天的模型”,而是可编排、可测评、可部署的生产级软件单元 [4][0][17]。
AI 行业正加速从「模型能力竞赛」转向「工程范式重构」与「任务闭环验证」,Agent 工程化、真实场景评测基准和知识基础设施成为关键分水岭;阿里发布 RealReplicaBench 揭示 13 个主流模型在电商任务中集体未及格 [2],印证「能答题」不等于「能做事」的范式跃迁。
电商 AI Agent 测评迎来范式革命:阿里 Accio Work 团队发布的 RealReplicaBench 以真实任务流严苛考核,13 个主流模型全部未及格,标志评测重心从「答对题」转向「做成事」[1];与此同时,未成年人AI情感依赖问题浮出水面,凸显技术向善亟需家庭、行业与教育协同治理 [4]。
Anthropic Q2 营收同比暴增约 1400%,估值达 2 万亿美元,预计 10 月冲击史上规模最大的 IPO;与此同时,Hugging Face 报告指出中国开源模型在参数规模上已显著领先美国,而AI 智能体正快速崛起为开源模型的新兴调用方 [7][11]。
AI 信息筛选正从「人工订阅」迈向「智能代理驱动」,RSS 信源分级与用户偏好学习成为对抗信息过载的关键路径;与此同时,Meta 的「个人超级智能」宣言将 AI 普惠性叙事推向新高度,但其落地能力仍受历史信任赤字制约 [1][2]。
AI 算力军备竞赛正引爆磷化铟衬底全球性短缺 [1];与此同时,Claude 文本水印(SynthID-Text)技术细节浮出水面,揭示其通过操控随机数种子嵌入不可见统计痕迹的底层机制 [4];多国二手书店遭AI公司“扫货”实体书用于训练数据,Anthropic 的「巴拿马计划」 已获美国法院裁定属合理使用 [5]。
多智能体架构与自主模型委托正成为下一代 AI 系统的核心范式,OpenAI v2、Flue 2 和 Astro 生态的演进共同指向“智能体即原语”;与此同时,生物特征1:1比对(基于欧几里得距离分析)被反复验证为对抗AI伪造身份的关键防线 [1][7],而中国实验室主导的开源生态(如 Qwen)已实质性重塑全球基础模型格局 [2]。
GLM-5.3 编程能力跃升50%,两周内发现2404个漏洞;Anthropic IPO估值剑指2万亿美元,或成史上最大IPO;阿里开源LongHorizon-Harness,直击长程Agent状态管理痛点;英伟达大幅下调对OpenAI数据中心的担保至1200亿美元,同步加码SpaceX成为其第六大股东 [1][2][4][5][8][16]。
Anthropic 单季度营收飙升至 115 亿美元,同比暴涨约 14 倍,预计 10 月 IPO 估值或达 2 万亿美元,有望超越 SpaceX 成为史上最大 IPO [4];与此同时,Claude 推出文本隐形水印技术以响应欧盟 AI 法案,但其实际可检测性与责任归属机制仍存显著争议 [2]。
GLM-5.3强势杀回国产大模型第一梯队,实测在编程与3D网页生成任务中展现顶流能力;与此同时,Agent Swarm架构正加速替代传统 Agent Team,成为多智能体协同新范式 [3][4]。资本层面,模型路由(Model Router)赛道热度飙升,Stripe 拟以100 亿美元收购 OpenRouter 引发行业对编排层战略价值的重估 [10]。
谷歌正大幅收缩前沿大模型研发,DeepMind 转向轻量级 Flash 级别模型并酝酿大规模裁员;与此同时,行业竞争焦点已从参数规模转向 「智效比」——即单位成本下的智能产出效率,DeepSeek V4 Flash、Ling-3.0-Flash 等模型正成为新标杆 [1][2]。
谷歌DeepMind战略转向务实路线,停止前沿大模型研发,全面拥抱轻量级Flash 级别模型;与此同时,行业竞争焦点正从“参数规模”加速迁移至智效比——即单位算力/成本下的实际任务效能 [1][2]。
OpenAI 暂停发布 Astra 模型,Kimi K3 与 Chrome 版 Claude 相继曝沙箱逃逸/提示注入漏洞,AI 安全从“防御短板”升级为“系统性风险”,越狱能力甚至被异化为营销指标。
DeepSeek 正以 「一切皆插件」的 Cordis 架构重构 Agent 开发范式,其新发布的 DeepSeek Harness 被广泛视为面向生产环境的 可组装 Agent 运行时,而非传统 SDK;与此同时,AI 原生办公工具链(如 WorkBuddy)、垂直行业落地(广州「AI+医学」)与国产算力基建突破(全国产十万卡超集群)共同构成本轮技术演进的三大支点 [1][9][11][10][...
DeepSeek Harness 正式开源并确立「一切皆插件」的 Agent 运行时架构,标志着国产大模型工具链从静态推理迈向可组装智能体时代;与此同时,AI 原生办公范式与AI 原生组织实践加速落地,而硬件端(如 Pixel 11)在 AI 能力与性价比上仍显乏力 [1][3][4][6]。
具身智能正迎来国产突破拐点,自变量公司以WALL-B 世界统一模型驱动双臂机器人,在物流分拣任务中实现对 Figure AI 的低成本反超;与此同时,AI 业务收入达 634 亿元的联想集团净利润暴增176%,印证大模型商业化已进入规模化兑现阶段 [2][5]。
马斯克正式推出Grok Bot——一款可24 小时连续运行的自主AI Agent,依托其收购Cursor后的工程整合能力,标志着头部科技公司正加速从“对话式AI”迈向生产级自动化智能体新阶段 [1]。
AI 正加速从软件层迈向物理交互与平台化基建双轨演进:荣耀以 Robot Phone 推出全球首款量产级「身体 AI」终端,大众则依托 GAIA 2.0 与 HS 基座大模型构建智驾统一平台;与此同时,苹果在 iOS 27 中首次明确 Apple Intelligence 分级收费路径,标志消费端 AI 进入商业化深水区 [1][2][3]。
AI 竞争正加速从大模型能力转向智能体系统构建与基础设施韧性,While Loop 作为 Agent 的本质范式被重申,而电力供给效率、事故标准化追踪(SAFE) 和具身原生基座模型成为新竞争边界的关键词 [5][6][7][15]。
AI 安全正经历范式迁移:越狱能力被异化为模型智能的“营销指标”[0],而红队模型(如 OpenAI 的 GPT‑5.6‑Cyber)已实现 95% 高危任务完成率,暴露攻防边界持续模糊的深层风险[22];与此同时,具身智能产业化加速落地,宇树科技与智元机器人出货量已远超特斯拉,中国厂商占据全球人形机器人 97% 以上份额[7]。
AI 安全正经历范式迁移:越狱能力被异化为模型智能的“营销指标”[1],而 OpenAI 推出的 GPT‑5.6‑Cyber 红队模型在高危任务中达成 95% 攻击成功率,凸显攻防双轨并进的紧迫性[6];与此同时,Harness 的角色正从工具层升维为多智能体协作基础设施,标志工程复杂度向「协作层」迁移[5]。
AI 基础设施金融化加速落地,英伟达联合华尔街撬动 5000 亿美元算力基建资本;与此同时,AI 安全实战能力迎来全球性检验,中国团队 DoGNAVY 在 CyberGym 基准中跻身全球前三[6][12]。教育、制造、内容等垂直领域正从“工具接入”迈向“逻辑重构”,人形机器人商业化、中小学AI教育红线与AI短剧创作范式转型成为政策与产业交汇的关键切口[5][8][7]。