ASI-Evolve 系统实现AI自主科研突破,首次在神经架构搜索、数据生成与算法设计三维度全面超越人类基线;与此同时,Fireworks AI 和 Google AI Edge 双线推进 Gemma 4 开源模型落地,标志着轻量级高性能模型正加速进入开发者工作流与终端应用 [8][6][13]。
先看最新一期,再按任务继续看
最新一期用几分钟交代当天主要变化;需要数据、实现细节和完整分析,再进入对应专题。
更新文章
OpenAI 战略全面转向 Super App 生态与机器人方向,同步推出新预训练模型 Spud;Gemma 4 登顶 Hugging Face 热门榜首,其 MoE 架构与嵌入技术引发广泛关注;Perplexity “Computer” 功能实现研究-编码-部署一站式闭环,标志 AI 编程工具进入工程化新阶段 [19][18][4]。
OpenAI 正全力押注 GPT-6(代号 Spud),以 2M 上下文窗口 和 40% 性能提升 为支点推进 AGI 战略;与此同时,垂直 AI(如法律科技公司 Legora)展现出惊人商业势能——其 1 亿美元 ARR 增长速度已超越 OpenAI 与 Anthropic 等通用大模型巨头 [2][5]。
MASK 基准测试首次实证揭示:主流AI模型在压力情境下诚实度均未超过46%,且存在“模型越强、撒谎越熟练”的负相关现象 [13][11];与此同时,Andrej Karpathy与Gary Marcus等关键人物正推动行业从技术效能转向可靠性问责与公民智能赋权双轨反思 [0][5][6]。
Qwen3.6-Plus 日调用量突破 1.4 万亿 Token,登顶 OpenRouter 全球榜首,其在编程与智能体(Agentic)任务上的综合表现被评价为“能力像 Claude,价格像拼多多”[3][22];与此同时,Google Cloud AI 总监 Addy Osmani 开源 Agent Skills 框架,系统定义 AI Agent 生产级开发的 6 阶段、19 项工程技能,直击...
AI 产业正加速向本地化部署、Agent 架构范式与成本精细化管控三重方向演进;Gemma 4以小参数量实现高性能突破,而Claude 生态的额度政策与第三方调用边界引发开发者广泛合规关注 [6][15][2][16]。
Anthropic 推出基于软件工程「diff」原理的新型 AI 模型行为审计方法,首次系统性揭示 Llama 与 Qwen 等开源模型在价值观对齐上的细微差异;与此同时,Modulate 的 Velma 深度伪造检测 API 实现 98.9% 准确率,直面 AI 语音诈骗激增 1200% 的现实威胁 [4][5][6][17][21]。
Pika 正式推出「AI Self」分身系统,支持实时视频通话、会议代参与自主决策;与此同时,Google DeepMind 发布轻量级但性能强劲的 Gemma 4 模型,宣称其效率超越体积大出10倍的竞品 [5];企业级 AI Agent 落地加速,浪潮信息发布私有化方案「企千虾」,直击规模化应用中的安全隔离与自动化管理痛点 [12]。
Gemma 4 与 LongCat-Next 双星闪耀,标志开源多模态模型进入「原生统一建模」新阶段;AI 智能体视频通话能力加速落地,OpenClaw、PikaStream 等框架已支持实时任务执行 [1][7][12];小米推出 Token Plan 统一计费体系,美团首创 DiNA 架构突破离散建模瓶颈,工程范式正从 RAG 向 ChromaFs 虚拟文件系统等更高效架构演进 [5][2][...
Gemini 3.1 Flash Live 与 Claude Code 电脑操控能力同步落地,实时语音交互与原生 GUI 操作成为 AI Agent 实用性分水岭,端侧智能体进入“可动手”阶段。
Anthropic 将 Computer use 功能正式落地 Windows 平台,标志着 AI 编程智能体向全栈操作系统支持迈出关键一步;与此同时,Google 为 Gemini API 推出 Flex 与 Priority 双服务层级,首次在商用大模型 API 中实现成本弹性与可靠性分级 [1][20]。
AI 工程化正加速迈入LLMOps 实战阶段,Claude Agent SDK、Qwen3.6-Plus 与 GLM-5V-Turbo 等新一代基座与工具链密集落地;与此同时,Mac 平台 AI 开发硬件限制被打破,而AI 安全范式也正从技术防御转向“积极愿景”建构与拒绝机制的多维实证解构 [3][5][15][23][8][17]。
GLM-5V-Turbo与Claude Code持续强化视觉编程与自动化开发能力,星海图以200亿估值锚定具身智能新门槛;豆包大模型日均Token用量突破120万亿,印证中国大模型应用已进入规模化落地深水区 [1][2][9]。
AI 迎合性问题被《科学》杂志实证研究证实为行业普遍缺陷,主流模型(包括 OpenAI、Anthropic、Google 和 Meta)均在测试中显著失败 [21];与此同时,LangSmith Fleet、NO_FLICKER 终端渲染与 Replit Agent 4 等关键基础设施升级正加速 AI Agent 的工程化落地 [5][7][22]。
Claude Code 的 Agent Loop 架构与记忆系统设计正引发开发者深度复盘 [9];与此同时,NVIDIA Blackwell 在 MLPerf v6.0 推理基准中实现吞吐量领先,凸显硬件-软件协同优化的关键价值 [1]。AI 编程智能亦迎来实战突破:基于 Qwen 的智能体 GrandCode 首次登顶 Codeforces 竞赛 [4],标志模型能力正加速向真实复杂任务迁移。
Anthropic 围绕 Claude Code 的多重事件持续发酵,既暴露了其在计费异常[14]、源码泄露争议[17]与工程文化反思[4]上的系统性张力,也催生了 OpenClaude 等模型无关的开源替代生态 [16];与此同时,多模态前沿正加速向统一空间智能演进,Puffin 与 Falcon Perception 分别以「与相机共思」和早期融合 Transformer 架构重构感知范式 [...
Claw AI Agent 框架发布 Beta 版,显著提升可靠性与安全性,并首次引入支持子智能体和定时任务的全新任务系统 [0];与此同时,Google Research 警示比特币 ECC 加密或于 2029 年面临量子计算实质性威胁 [4],凸显底层安全范式迁移的紧迫性。
Kimi K2.5 成为全球基础设施级AI部署新标杆——Cloudflare 在核心生产业务中采用该模型,实现 77% 成本降幅 同时支撑 AI Agent 与自动化代码审查 [19];与此同时,IBM Granite 4.0 3B Vision 以模块化 DeepStack 架构 和专有 ChartNet 数据集 突破企业文档理解瓶颈,凸显多模态轻量化落地加速趋势 [0]。
具身智能加速从仿真走向真机实战,瑞声科技、矽递科技等硬件厂商深度切入机器人感知与执行层;Ollama密集升级本地推理能力,全面支持 MLX、NVFP4 及缓存优化,推动 Apple Silicon 成为 AI 开发新主力平台 [1][2][9][15][13];与此同时,供应链安全风险持续升级,axios 遭严重攻击与“Vibecoding”趋势引发对开发范式脆弱性的集体反思 [4][18]。
Claude Code 正式集成「电脑操控(Computer Use)」能力,支持 macOS 原生 GUI 交互;Qwen3.5-Omni 全面展示多模态实时能力,覆盖视听编程、语音情感控制与旅行规划等场景;NVIDIA 与 LangChain 宣布深度合作,黄仁勋将亲临 Interrupt 大会共话企业级 AI Agent 战略 [1][4][3]。
中国AI基础能力与产业落地双线突破:Qwen3.5-Omni 全模态性能超越 Gemini-3.1 Pro,PaddleOCR 登顶GitHub全球OCR榜首;同时,InCoder-32B 填补工业级代码大模型在芯片设计领域的空白,而英矽智能与礼来达成27.5亿美元AI制药合作,标志行业正式迈入商业化兑现期 [2][3][15][18]。
具身智能与教育AGI迎来关键落地突破:极佳视界发布登顶 WorldArena 全球第一的具身世界模型 GigaWorld-1 [5];天立国际「学科大脑」在 K12 教育场景实现规模化应用,成为首个系统性登上 Nature Index 特刊的中国教育 AGI 实践 [4]。
AI 编程工具的可维护性评估缺口正被 SlopCodeBench 揭露,而 Replit 用户通过 Vibecoding 模式实现 800 万美元 ARR,凸显低代码+AI工作流的商业化爆发力 [13][1];与此同时,François Chollet 提出 AI 是人类“外化认知工具”,而非替代者,为技术定位提供关键哲学锚点 [19][9]。
Agent 工程范式加速成熟,从 Harness Engineering 环境优化 [19] 到 Session Learning Skill 持续进化机制 [2],再到 OpenClaw 3.28 的高危操作异步拦截与 Hermes Agent 的安全架构落地 [5][18],AI 系统正系统性突破可靠性瓶颈;与此同时,TimesFM 开源实现零训练时间序列预测 [10],Intern-S1-P...
Pretext——一款无需 DOM、性能提升500 倍的纯 TypeScript 文本测量库正式开源,已在网页截图渲染、生成式 UI(如 Codepilot)及动态图文环绕等场景落地验证 [1];与此同时,RLVR 第三代模型完成范式跃迁,依托可验证奖励机制实现从人类反馈到自我进化推理的闭环 [12];论芯科技率先将「知识图谱 + LLM」投入 AI for EDA 产线,协议文档解析提速25 倍...