LLM 是无状态的:每次请求重传全部上下文,会话一结束一切归零——这既烧钱,又让 agent 永远学不会你的项目。 我们给它补上认知层:内容寻址证据库把传输压到最低, 可验证记忆、世界模型与技能 Runbook 让它跨会话越用越懂你。
节省比例因项目而异——装好后运行 cursor-token-saver bench,用你自己的代码库实测。
基于 Cursor 官方 hooks 和 MCP 接口,在工具调用层拦截浪费,不改模型、不改代码。
超大文件读取、重复命令输出、没变的文件重读——在进入上下文之前被替换成大纲、差分或一行"内容未变"标记。
每次截断都留下稳定的证据 ID。agent 真需要原文时,一次调用精确恢复任意行区间——省的是浪费,不是信息。
约定、决策、踩过的坑、部署流程沉淀为可验证的记忆;新会话热启动包用几百 token 恢复全部任务状态。
四层架构,一个闭环:感知 → 记忆 → 回忆 → 行动 → 反馈 → 学习。绿色主线是无损回注路径——模型只收最小首屏 + 证据 ID。
这不是一堆提示词技巧,而是一套认知架构(Cognitive Architecture):感知 → 记忆 → 回忆 → 行动 → 反馈 → 学习。
所有被截断/压缩/差分的内容按内容哈希落盘,生成稳定证据 ID。模型默认只收最小首屏,任意行区间可按 ID 精确恢复——省的是"默认全量传输",不是信息。
工程事实(约定/决策/坑/入口)挂关联文件的内容哈希:文件一变自动标 STALE;机械提取只是候选,确认才生效。"存了就信"的记忆迟早变成负资产,可验证性是记忆系统的生命线。
自动从 package.json / docker-compose / nginx / CI 提取「实体 --关系--> 实体」三元组:域名→端口→服务→脚本。实体子图一到两跳查询,一行三元组顶几百行配置文件。
任务收尾自动从命令时间线提取 Runbook(目标 + 成功命令序列);同一流程复发时置信度上升。人类的技能记忆如何工作,agent 的就该如何工作。
同一命令从失败转成功、期间又有文件编辑——系统自动记下"命令 X 曾失败,改了 A、B 之后通过"。踩过的坑沉淀为经验,不踩第二次。
hooks 观测读写与命令(感知)→ 沉淀可验证记忆(学习)→ 检索融合代码与记忆(回忆)→ 热启动包延续任务(延续)。agent 在你的项目里越用越便宜、越用越懂。
每一项都遵循同一条铁律:fail-open,绝不因为工具故障挡住 agent 干活。
增量重读只传行级差分;重复命令只传和上次的差异;数据文件给结构画像。全部可恢复。
精确匹配 + BM25 + 本地神经向量三路融合,低置信度自动扩大候选,先给预览再按需展开。
工程事实挂文件哈希存储:文件变了自动标过期,机械提取只生成候选、确认才生效——不会积累幻觉。
自动从 package.json / docker-compose / nginx / CI 提取"域名→端口→服务"关系图,一行三元组顶几百行配置。
任务收尾自动提取成功命令序列;失败→修复的过程被记录成"坑",下个会话直接复用。
多项目统一视图:节省统计换算成钱、浪费洞察、记忆审阅、检索质量评测,一键启动。
与云端记忆产品不同,这里的索引、嵌入、记忆、统计全部存在本地。 神经嵌入用本地 ONNX 推理,没有遥测、没有电话回家,授权校验也是离线签名。 对合规敏感的团队,这不是一个功能,是前提。
免费版完整可用,不是试用版。付费买的是团队协作和跨设备能力。
不会,这是整个设计的第一约束。所有压缩都是无损的:截断处留证据 ID,agent 一次调用即可精确恢复原文任意区间。检索有三路融合和自动兜底,LSP 不可用会降级到导入图。规则明确引导 agent"不确定就展开",而不是靠猜。
我们不给统一数字,因为节省取决于你的项目和操作构成。装好后运行 cursor-token-saver bench,它在你的真实代码库上重放六类典型操作,输出带完整口径说明的对比报告——度量的是传输层 token,不承诺账单降幅。
机械提取的记忆全部是"候选"状态,agent 或你确认后才生效;挂了文件的记忆存内容哈希,文件一变自动标记过期;长期没用到的自动归档。面板上每一条都能看、能改、能删。
所有文件都在项目的 .cursor/ 目录和 ~/.cursor-token-saver/ 下,删掉即完全卸载,不碰你的代码和 git 历史。
所有 hooks 都是 fail-open 的:任何异常都放行原始操作,最坏情况是回到没装插件的状态,绝不会挡住你干活。