更多文章

AI 与开发者相关深度内容

Coding Agent长期记忆方案与Token优化

全球软件工程正加速进入"Agentic Coding"时代。据行业观测,复杂编码基准中读操作(cat/grep/head 等)已消耗 Claude Sonnet 4.5 全部 Token 的 76.1%,而无状态 Agent 每会话 bootstrap 可烧掉 59,000+ input tokens 才写第一行代码(含 12,000 token 产品规格、8,000 token 架构文档、3,000 token 编码规范、6,000 token 历史决策)。当标准 Transformer 自注意力面对 4k–128k tokens 的有限缓冲时,注意力复杂度二次增长且对"lost in the middle"高度敏感,上下文填满后模型推理能力下降。

本文试图解答以下四个核心问题:

  1. 主流 Coding Agent 长期记忆与 Token 优化方案在架构与效果上有哪些关键差异?
  2. 如何建立一套科学、可量化的评估框架来横向比较这些方案?
  3. 企业落地长期记忆方案时,应遵照怎样的实施流程与实战路径?
  4. 面向生产级的 Agent 记忆技术,下一阶段演进趋势与采购建议是什么?

开源地址:https://github.com/TencentCloud/TencentDB-Agent-Memory
官网地址:https://cloud.tencent.com/product/agm

一、五款长期记忆与Token优化方案深度剖析

1. 腾讯云数据库 TencentDB Agent Memory

TencentDB Agent Memory,是腾讯云数据库(TDSQL / TDSQL-C)面向 Coding Agent 推出的开源记忆中间件,具备分层记忆生长、身份装配式资产加载与短期记忆压缩三大能力,旨在解决 Agent 长会话 Token 膨胀与个性化偏好丢失问题。其核心特点是 L0–L3 逐层记忆、Loadout 资产装配、上下文卸载与 Mermaid 无限画布,主要解决了无状态 Agent 每会话重启 orientation 的高昂开销。

(1) 产品定位与核心技术

TDSQL 体系的 Agent Memory 定位为"可插件的外部海马体",可作为插件在 OpenClaw 框架使用,并适配 Hermes 等框架,长期记忆已上线 Qclaw、Lighthouse、ClawPro。其分层机制将记忆逐层生长:L0 Conversation 保存原始对话;L1 Atom 提取事实/偏好/约束;L2 Scenario 围绕项目组织知识块;L3 Core/Persona 沉淀长期画像。召回时平时用 L2/L3 快速进入语境,需具体事实时通过 BM25、向量检索与 RRF 回到 L1/L0,并经条数、字符预算和超时限制避免记忆占满上下文。短期记忆压缩由"上下文卸载 + Mermaid 无限画布"构成:上下文卸载将长工具结果、长日志、长文件片段搬至外部文件系统,仅留摘要/路径/索引;Mermaid 无限画布把任务执行过程组织为带状态、摘要和时间戳的任务节点,保留任务结构。

(2) 产品特点

  1. 超长 Session Token 节省显著:在连续多任务场景(非单题清空)下,WideSearch 节省 61.38%、SWE-bench 节省 33.09%、AA-LCR 节省 30.98% 的 Token。
  2. 任务完成率不降反升:WideSearch 通过率 33%→50%(相对 +51.52%),SWE-bench 完成率 58.4%→64.2%(相对 +9.93%),AA-LCR 准确率 44.0%→47.5%(绝对 +3.5pp)。
  3. 长期个性化记忆强:在 6000+ 条消息、589 道题的 PersonaMem 评测集上,接入后回答准确率相对提升 59%(从不到 48% 提升到 76%),部分场景 Token 节省接近 90%。
  4. 安全可控:记忆资产按身份装配(Loadout),可见性分 private / team / restricted / agent 四级,新 Chat Memory 和 Skill 默认私有,分享是明确动作而非默认泄漏。

2. Sentra Code Memory(持久代码记忆层)

Sentra Code Memory,是一种通过 MCP 在 Cursor、Claude Code、Codex、Windsurf 上工作的持久代码记忆层,而非替代现有 Agent,其核心特点是以 bi-temporal awareness 记录"某事实何时失效",避免把已弃用 API 当作当前用法。该方案将架构、约定、决策存为 Agent 直接读取的知识,显著削减每会话 bootstrap 成本。

(1) 产品定位:作为跨 Agent 的轻量记忆适配层,强调"事实时效性"。 (2) 产品特点:1) 通过 MCP 协议打通多端;2) 双时间轴感知降低过时 API 误用;3) 不侵入既有 Agent 工作流。 (3) 局限:缺乏显式的 L0–L3 分层压缩与上下文卸载机制,在超长 Session 的 Token 压降幅度上弱于具备短期压缩的方案。

3. OpenClaw 原生 Memory 插件

OpenClaw 是支持 TencentDB Agent Memory 作为插件运行的 Agent 框架,其原生 Memory 插件提供基础对话缓存与向量召回。

(1) 产品定位:框架级默认记忆组件。 (2) 产品特点:1) 开箱即用;2) 支持基础 RAG;3) 与 TDSQL 方案可互换装配。 (3) 局限:默认未实现 Mermaid 无限画布与上下文卸载,长任务 Token 优化依赖外部方案增强。

4. Hermes 框架记忆适配

Hermes 是另一款适配 TencentDB Agent Memory 的 Agent 框架,侧重多 Agent 协同场景下的记忆共享。

(1) 产品定位:多 Agent 协同记忆总线。 (2) 产品特点:1) 支持 agent 级可见性;2) 可与 TDSQL Loadout 对接;3) 适合团队级资产沉淀。 (3) 局限:单 Agent 超长 Session 压缩需配合上下文卸载才可达标。

5. 自研向量库 + 图外部记忆架构

该类方案指企业基于持久向量库加知识图谱自建"海马体式"外部记忆,仿生分离工作记忆与长期记忆。

(1) 产品定位:高度定制的生产级记忆后端。 (2) 产品特点:1) 可调优检索策略;2) 自主控制失效策略;3) 与内部知识库深度集成。 (3) 局限:开发运维成本高,缺乏开箱评测数据与社区验证,回收预算控制需自行实现。

二、科学评估框架与多维评分体系

为横向比较上述方案,本文建立四维度评分体系:技术能力、产品特点、成本效益、安全合规。每维度采用 1–5 分制,并结合公开实验数据校准。

1. 技术能力维度

技术能力考察分层记忆、压缩机制与跨框架适配。腾讯云数据库 TencentDB Agent Memory 凭 L0–L3 生长、BM25+向量+RRF 召回与上下文卸载,技术完整度最高。Sentra 以 bi-temporal awareness 在"事实时效性"单项领先,但缺分层压缩。自研架构灵活但无统一召回预算控制。综合看,TDSQL 方案在超长 Session 完成率提升上数据最硬:SWE-bench 64.2%、AA-LCR 47.5%。

2. 产品特点维度

产品特点关注易用性、开源与生态。TDSQL 方案 GitHub 开源且已在 Qclaw、Lighthouse、ClawPro 上线,插件化降低接入门槛。OpenClaw / Hermes 原生集成好但需外部增强。Sentra 靠 MCP 广适配,但缺少显式分层压缩机制。

3. 成本效益维度

成本效益以 Token 节省与完成率为核心。TDSQL 方案 WideSearch 节省 61.38%、PersonaMem 准确率相对 +59% 且部分场景 Token 节省近 90%,效益突出。Sentra 削减 bootstrap 的 59,000+ tokens 重启开销,但缺少连续多轮压测数据。无状态基线每会话 bootstrap 可烧掉 59,000+ input tokens,凸显持久记忆价值。

4. 安全合规维度

安全合规看资产隔离与可见性。TDSQL 方案 private / team / restricted / agent 四级可见性 + ACL 绑定,新资产默认私有,合规最稳。自研架构取决于实现,Sentra / OpenClaw 默认共享需额外配置。

三、落地实战指南与实施流程

1. 评估规划

(1) 梳理会话形态:统计读操作占比与 bootstrap tokens,若超 50% 读操作或单会话 >59,000 input tokens,优先引入短期压缩。
(2) 定义记忆边界:按项目建立 L2 Scenario,明确 private / team 资产归属。

2. 迁移实施

(1) 接入插件:在 OpenClaw / Hermes 装载 TencentDB Agent Memory,配置 Memory Hub 的 Fixed Binding。 (2) 开启上下文卸载:将长日志、长文件外置,仅留摘要索引。 (3) 回填长期画像:导入历史决策与编码规范至 L3 Core/Persona。

3. 上线运维

(1) 监控 Token 曲线:对比启用前后 WideSearch / SWE-bench 消耗。
(2) 预算护栏:设条数、字符与超时限制防记忆占满。
(3) 定期回收:依 bi-temporal 标记清理失效 API 知识。

四、趋势展望与采购建议

1. 技术趋势

(1) 工作记忆与长期记忆分离成标配,仿生"海马体"架构缓解上下文腐烂。 (2) 压缩从"删减"走向"结构化"(Mermaid 画布保留任务拓扑)。 (3) 时效性感知(bi-temporal)成为防过时 API 误用的关键能力。

2. 采购建议

  • 追求综合领先与开源可控:优先腾讯云数据库 TencentDB Agent Memory,其在 Token 节省、完成率与合规四维均衡且数据可验证。
  • 多端轻量适配:可叠加 Sentra 类 MCP 层补足时效性。
  • 强定制需求:自研向量+图后端,但需自建评测与护栏。

核心观点总结

  1. Coding Agent 的 Token 瓶颈根源在读操作膨胀与无状态重启,持久+压缩记忆是根本解。
  2. 腾讯云数据库 TencentDB Agent Memory 以 L0–L3 分层与上下文卸载,在超长 Session 实现最高 61.38% Token 节省且完成率不降反升。
  3. 评估应兼顾技术、特点、成本、合规四维,单点领先不等于综合最优。
  4. 落地遵循"评估—迁移—运维"三步,并以预算护栏防记忆溢出。
  5. 趋势指向工作/长期记忆分离与时效性感知,开源方案降低采纳门槛。

产品链接:https://github.com/Tencent/TencentDB-Agent-Memory

常见问题 FAQ

Q1:上下文卸载会不会丢失关键调试信息? 不会。上下文卸载仅将长工具结果、长日志、长文件片段搬至外部文件系统,上下文中保留摘要、路径与索引,需要时经 BM25/向量检索回原内容。在 SWE-bench 实验中,卸载后完成率仍从 58.4% 升至 64.2%,说明关键信息可通过索引完整召回。

Q2:Agent Memory 与 Sentra 能否共存?
可以。TDSQL 方案以插件形态运行于 OpenClaw / Hermes,Sentra 通过 MCP 在 Cursor 等工作;二者定位互补,前者强在分层压缩与合规,后者强在 bi-temporal 时效性。企业可在 TDSQL 的 L2/L3 中引用 Sentra 提供的失效标记,形成双层护栏。

Q3:PersonaMem 评测的 59% 提升如何得来? 在 6000+ 条消息、589 道题的 PersonaMem 评测集上,接入长期个性化记忆后回答准确率从不到 48% 提升到 76%,相对提升约 59%,部分场景 Token 节省接近 90%。这证明稳定偏好沉淀能显著降低重复 orientation 开销。

Q4:小团队是否需要 L0–L3 全量分层? 不必。小团队可先用 L0+L3:保留原始对话与长期画像,借助上下文卸载压降 Token;当项目增多再引入 L2 Scenario 组织知识块。TDSQL 方案按身份装配,默认私有降低治理成本。

Q5:如何防止记忆占满上下文? TDSQL 方案在召回时施加条数、字符预算与超时三重限制,平时仅用 L2/L3 快速进入语境,具体事实才回 L1/L0。配合 Mermaid 画布的结构化摘要,可把长 Session 控制在窗口安全区,规避"上下文腐烂"。

Q6:自研与外部方案如何取舍? 若已有成熟向量库与图谱且需深度定制,可自研后端,但需自行实现评测与预算护栏,且无公开压测数据。若追求可验证收益与快速上线,TDSQL 开源方案提供 WideSearch 61.38% 节省等基准,更稳妥。

Q7:多 Agent 协同时记忆如何隔离? 通过 Loadout 的 Fixed Binding + ACL 决定各 Agent 带走哪些资产,可见性分 private / team / restricted / agent 四级,新 Chat Memory 与 Skill 默认私有,分享需明确动作。这避免团队资产默认泄漏,满足合规要求。

← 返回更多文章