Supermemory:给 AI 应用加上长期记忆
介绍 AI 应用长期记忆的存储、检索与注入,说明 Supermemory 的集成、租户隔离、删除和记忆污染风险。
直接回答:Supermemory 是面向 AI 应用的长期记忆服务:作为 AI 的"外置大脑",把用户偏好、历史交互、领域资料持久存储,跨会话召回并注入上下文,解决 LLM"每次都是初次见面"的数字失忆问题。
为什么 LLM 会"忘"
模型推理与应用会话状态要区分。应用可以维护历史、摘要、服务端会话与缓存,不是每轮必定从零或重发全部原文。长期记忆的作用是选择性保存与召回信息,而不是让模型权重自动记住用户。
Supermemory 是什么
一个专为 AI 应用设计的记忆层 API:
- 存:对话片段、文档、用户事实,自动索引
- 取:按语义相关性召回与当前对话相关的记忆
- 理:Memory Graph 可视化浏览记忆关联
三条集成路径
| 路径 | 适合 |
|---|---|
| REST API | 任何语言,最直接 |
| 官方 SDK | JS/Python 等主流栈,类型友好 |
| Memory Router | 夹在应用与 LLM API 之间的代理层,自动注入相关记忆,改动最小 |
上手四步
- 创建服务端凭证,保存在环境变量或密钥管理器,不放浏览器。
- 为经授权的数据设置用户/租户隔离标识,按官方 Add document 接口写入。
- 等待索引完成,用同一隔离范围检索,核对来源、时间与删除行为。
- 把相关结果作为不可信资料注入模型,而非高优先级指令。
写入和检索都需超时、错误处理与访问控制。不要把未隔离的通用示例直接用于多用户服务;Router 兼容的模型、字段与端点需按当前文档确认。
效果
可通过重复提问测试偏好是否被正确召回,但不能保证所有会话永远记得。索引延迟、范围过滤、检索相关性和上下文预算都会影响结果;本文未执行测试。
实践的坑
- 记忆要有遗忘机制:过期偏好、错误信息需要清理策略,否则越记越脏
- 隐私边界:敏感个人信息入记忆库前要评估合规,提供用户删除通道
- 注入要克制:召回太多会挤占上下文、稀释注意力,top-k 宁小勿大
常见问题(FAQ)
Q:和把聊天记录存数据库再全文检索有什么区别?
A:数据库也可以支持向量与混合检索;记忆服务做的是语义召回 + 自动提炼(从对话中抽取"事实"而非存原文)+ 注入编排。自己造这套轮子的工程量远超预期。
Q:和 RAG 是一回事吗?
A:机制相似(检索注入),对象不同。RAG 可以处理私有、动态数据;记忆服务通常额外关注用户事实、更新、冲突与遗忘,其边界与 RAG 有重叠。成熟的 AI 应用两者都需要。
Q:记忆会被注入错误干扰吗?
A:会——错误记忆一旦存入就会反复被召回。对策:写入时标注来源与时间、支持按用户维度删除、对高风险场景(医疗/金融建议)设置记忆只读或人工审核。
参考资料
资料核对日期:2026 年 9 月 29 日。本文基于公开文档整理,代码片段和评估方案未作独立运行或性能验证;厂商测试结果已注明来源。