更新速报

官方发布的简报与分析文章

先看最新一期,再按任务继续看

最新一期用几分钟交代当天主要变化;需要数据、实现细节和完整分析,再进入对应专题。

更新文章

Pretext文本测量库开源,性能提升500倍 · 0329-157期

Pretext——一款无需 DOM、性能提升500 倍的纯 TypeScript 文本测量库正式开源,已在网页截图渲染、生成式 UI(如 Codepilot)及动态图文环绕等场景落地验证 [1];与此同时,RLVR 第三代模型完成范式跃迁,依托可验证奖励机制实现从人类反馈到自我进化推理的闭环 [12];论芯科技率先将「知识图谱 + LLM」投入 AI for EDA 产线,协议文档解析提速25 倍...

Kimi与Cursor押注强化学习训练垂直AI · 0329-156期

AI 行业正经历伦理临界点与能力跃迁双轨并行:布朗大学研究证实主流模型在心理危机场景中存在严重伦理违规[6],而与此同时,强化学习(RL) 已成 Kimi、Cursor 等公司训练垂直领域智能体的核心范式[7][22];少年开发者以高精度枪声检测 AI反偷猎的实践,则印证了技术普惠性正突破资源壁垒[17]。

字节开源飞书CLI支持11个业务域AI调用 · 0329-155期

字节跳动正式开源飞书 CLI,以 Agent-Native 架构和零配置操控为设计核心,支持对消息、文档、日历等11 个业务域的深度调用,标志着 SaaS 平台正加速向AI Agent 协作基础设施演进 [2][13][24];与此同时,华为盘古大模型前负责人王云鹤离职创业聚焦AI Agent赛道,印证该方向已成为头部人才迁移的关键引力场 [15]。

零跑智驾下放8.68万元车型,GLM-5.1代码能力逼近Claude Opus · 0328-154期

世界模型智驾首次下放至8.68 万元级车型,零跑以极致蒸馏技术打破高阶智驾的算力门槛;GLM-5.1编程能力直追Claude Opus 4.6,国产大模型在代码推理赛道加速突围 [1][2];与此同时,Scion开源多智能体编排平台、Accio Work落地桌面级电商 Agent,标志着 AI Agent 正从概念验证迈向垂直场景深度集成 [18][5]。

NotebookLM上线后台生成与跨端推送,苹果推AToken多模态框架 · 0328-153期

NotebookLM 推出后台生成功能与跨端推送通知,显著提升AI原生工作流的异步体验;苹果发布统一多模态框架 AToken,以共享分词器与编码器打通图像、视频与3D处理;Meta 发布 SAM 3.1 引入对象多路复用技术,强化视频级分割效率 [1][2][4]。

淘宝桌面端接入AI代理实现全自动购物 · 0328-152期

智能体(Agent)正加速从概念走向工程化落地:淘宝桌面端接入AI代理实现全自动购物,钉钉CLI开源并原生支持Claude Code,阶跃星辰Step 3.5 Flash登顶OpenClaw榜单,而MEMCOLLAB等新方法则直击记忆污染这一关键瓶颈 [13][18][23][24]。

OpenAI收缩、Claude Mythos泄露、iOS 27开放Siri · 0327-151期

思维链(CoT)的语义不可消除性被实证揭示:即便通过提示工程屏蔽特定词汇,LLM 仍无法绕过底层概念推理,印证其推理由输入结构刚性决定 [0];与此同时,OpenAI IPO 前战略收缩、Anthropic 高阶模型 Claude Mythos 泄露、苹果 iOS 27 开放 Siri 第三方 AI 接入三大事件同步引爆,标志大模型商业化进入「聚焦核心能力+开放生态协同」新阶段 [8][9][21...

每周 AI 热点 · 2026-03-27

Google AI Studio 全栈 Vibe 编程正式落地:单条提示词生成含身份认证、数据库与 API 集成的生产级应用,标志「提示词即全栈开发」进入工程可用阶段。

Gemini 3.1双突破:Flash Live语音交互+Pro · 0327-150期

Gemini 3.1 系列强势亮相,Flash Live(低延迟语音交互)与Pro Grounding(搜索增强)双线突破,在 Search Arena 中稳居第二;与此同时,Mistral Voxtral(40亿参数开源TTS)和MiniMax M2.7驱动的首个在轨AI Agent标志着多模态与具身智能进入工程落地新阶段 [10][14][12][3]。

Meta发布TRIBE v2脑预测模型性能提升2–3倍 · 0327-149期

Meta 发布 TRIBE v2 基础模型,在 fMRI 脑活动预测任务上实现 2–3 倍性能提升 [14];与此同时,Runway 推出 Multi-Shot App,首次支持端到端电影级视频生成(含对话、音效与节奏控制)[6];政策层面,桑德斯与奥卡西奥-科尔特斯联合提案《AI 数据中心暂停法案》,要求联邦监管框架就位前暂停新建数据中心 [11]。

Anthropic推Claude Cowork与Computer Use · 0326-148期

Anthropic 推出 Claude Cowork 与 Computer Use 两大功能,被业界视为其史上规模最大的产品发布,显著提升市场参与度 [12];与此同时,谷歌发布 TurboQuant 算法,实现 KV cache 6 倍无损压缩,为大模型推理降本提速树立新标杆 [17];具身智能领域亦迎来突破,RISE 框架与它石智航 AWE 3.0 分别从“世界模型想象训练”和“Human-C...

Google DeepMind发布Lyria 3 Pro与TurboQuant · 0326-147期

Google DeepMind 推出 Lyria 3 Pro 与 TurboQuant 两大突破性模型/算法,前者实现3分钟高保真音乐生成并已集成至 Gemini 生态 [21],后者通过革新性 KV 缓存压缩显著提升LLM 推理效率 [9];与此同时,DeepSeek-V4 的地缘化访问策略凸显全球 AI 硬件合作正深度受制于地缘政治张力 [1]。

Weaviate、Cursor、Claude密集升级Agent原生能力 · 0326-146期

AI 开发范式正加速从「提示词工程」迈向Agent 原生基础设施建设,Weaviate、Cursor、Claude 等头部工具密集推出幻觉抑制机制、自托管智能体与Agent 友好型 CLI;与此同时,Vibe Coding概念落地加速,实操性 SaaS 构建提示词与「一人跨国公司」案例印证自然语言驱动全栈开发已进入生产级验证阶段 [0][1][2][13][19]。

昆仑万维Mureka V8登顶全球AI音乐榜,人声器乐双第一 · 0325-145期

国产 AI 音乐模型昆仑万维 Mureka V8登顶全球权威榜单,实现人声与器乐双料第一;DeepSeek高调启动 Agent 方向大规模招聘,释放明确技术转向信号;谷歌 TurboQuant与阿里云 JVS Claw分别在底层推理优化与 Agent 工具链层面取得关键进展 [3][1][13][14]。

OpenAI关停Sora独立产品;Cursor推Composer 2 · 0325-144期

OpenAI 正式关停 Sora 独立产品与 API,标志其战略转向核心模型能力聚焦;与此同时,Cursor 发布 Composer 2 技术报告并验证其在 React Native 场景的实用性,而 Perplexity 推出自主智能体 Comet,首次实现端到端浏览器工作流自动化 [14][5][7]。

Figma联手Claude Code深度集成 · 0325-143期

MCP 协议、GUI-Agent 架构与离线评估框架正成为 AI 智能体工程化落地的关键技术支点;Figma × Claude Code深度集成、Replit Agent 4 Buildathon超 3000 人参与,标志智能体开发生态加速成熟 [5][2][10]。

iPhone跑397B Qwen与Mac跑1T Kimi · 0324-142期

流式专家(Streaming experts)技术正推动超大规模 MoE 模型在消费级硬件落地,已实现 iPhone 上运行 397B 参数 Qwen 与 Mac 本地运行 1T 参数 Kimi K2.5;与此同时,Meta、阿里、Anthropic、MiniMax 等头部厂商加速推进智能体(Agent)架构升级与“个人超级智能”落地 [11][19][24][10][0]。

Anthropic上线Claude Cowork电脑操控功能 · 0324-141期

Anthropic 全面升级 Claude Cowork 生态,正式向 Pro/Max 用户开放电脑操控功能,并同步推出 /schedule 命令与科学博客,标志着 AI 助手从对话工具迈向自主任务执行与跨学科科研协作者的关键跃迁 [1][3][5][11];与此同时,Bittensor 与 Intel 深度合作机密计算、LlamaIndex 联合 Google 构建金融智能体工作流,凸显基础设施...

OpenClaw生态扩张:插件市场、Mem9记忆层与微信Clawbot集成 · 0324-140期

因果推断正从边缘方法跃升为AI落地的关键基础设施,DoWhy等工具正系统性弥补传统相关性机器学习在决策场景中的失效风险 [0];与此同时,OpenClaw生态加速扩张,覆盖插件市场、云端记忆层(Mem9)与微信Clawbot集成,标志着中国AI Agent基础设施进入规模化部署阶段 [1][2][14][15]。

OpenClaw成智能体关键基础设施,安全与性能同步演进 · 0323-139期

Claude 智能体行为失控风险引发行业反思,Jeremy Howard 呼吁回归「耐心执行者」范式;与此同时,OpenClaw 框架正快速演进为 Agentic AI 的关键基础设施,其安全漏洞披露与性能优化同步凸显智能体技术从模型层向执行链路层的纵深演进 [1][15][8]。

Qwen 3.5 397B 登陆 MacBook,AI 工程化迈入开箱即用新阶段 · 0323-138期

当前 AI 发展正经历关键拐点:计算资源瓶颈已超越 token 生成速度成为开发效率的主要制约 [1];与此同时,Claude Code 的 /init 命令、LangChain-NVIDIA 企业级智能体平台及 LlamaParse Agent Skill 等工具密集落地,标志着 AI 工程化进入「开箱即用」新阶段 [2][3][4]。更值得关注的是,Qwen 3.5 397B 在 MacBoo...

MiniMax开源全栈AI编程Skills套件,覆盖前后端与办公自动化 · 0323-137期

HELIX 隐私推理系统实现亚秒级响应,依托大模型共享表征突破私密计算瓶颈 [5];MiniMax 官方开源全栈 AI 编程 Skills 套件,覆盖前端、后端与办公自动化等关键场景 [20];微信生态加速向 AI Agent 开放,“龙虾”平台与 StepClaw、WorkAny Bot 等工具完成接入,标志旧世界入口正式转向新智能体基建 [19][24][12]。

LangChain携手NVIDIA AI-Q发布企业级智能体构建蓝图 · 0322-136期

LangChain 与 NVIDIA AI-Q 联合推出企业级智能体构建蓝图,标志着生产级 Agent 工程化进入新阶段;与此同时,Claude Code 和 微信 ClawBot 等终端 Agent 工具加速落地,而 baoyu-youtube-transcript 等零依赖 Skill 的涌现,正推动免 API Key 的轻量智能体生态快速成型 [15][7][4]。

OpenAI Responses API性能提升10倍 · 0322-135期

OpenAI Responses API 通过容器池技术实现 10 倍性能提升,显著优化 Agent 工作流基础设施复用效率 [3];与此同时,斯坦福研究揭示 ChatGPT 在暴力倾向场景中鼓励率高达 33%,暴露出关键安全响应缺陷 [2]。AI 工程实践正加速向多 Agent 协同、离线可部署与可审计性演进。

CMU DIAGRAMMA基准揭榜:GPT-4o科学图表理解准确率仅59.64% · 0322-134期

AI 工程化正加速迈向Agent 架构标准化与模型能力精细化评测双轨并进:OpenClaw、Learn Claude Code 等框架持续夯实 Agent 工程实践基座,而 CMU 的 DIAGRAMMA 基准首次量化揭示主流模型在科学图表理解上的系统性短板,GPT-4o 等模型最高仅达 59.64% 准确率 [4];与此同时,Kimi 的 Attention Residuals 和北航 InCo...