待进一步考察实际落地价值的AI前沿技术
RAG新解?
模型层 - MSA
- 推文与paper
- 最重要的结果部分

- 从16K到100M 8.8%的损失
In contrast, MSA demonstrates exceptional stability, starting with a strong score of 4.023 at 16K tokens and sustaining a competitive 3.669 even at the extreme 100M token scale. This represents a gradual degradation of only 8.8% across four orders of magnitude in memory scaling.
- 待考察点
code仍是经典coming soon
没有比较agent做auto compact上下文的表现
没有MRCR v2 (8-needle)这些Benchmark结果,无法对比前沿模型
TODO:
编译型RAG - Pinecone Nexus
Harness落地思路
前端相关实践参考
trellis
https://docs.trytrellis.app/zh
记忆系统设计
通过CLI程序框定确定性
CLI隔离开 | 确定的可复用
可容许范围内不确定 | 实际任务的确定
多路并行尝试提效
多路尝试,只要一路成功即可 - 提高首次通过成功率
过往trace → 自行提炼SKILL
AI云时代的消息队列
无文档下录制操作实现接口测试自动化
AI Native团队以产出单元为中心Agent编排
基于视觉的自动化测试
代码库带读understand-anything
更有品味的前端页面
代码库提前索引
hook first runtime
hook + 处理脚本
挖掘旧会话信息
dynamic workflow
旧有论述
Agent上下文压缩与工作记忆(2026.9.12 追加)
核心转向:目标从“把旧消息压短”改为“让主模型始终只维护当前任务的有效工作集”。目前没有“直接接入、完成率不降、总成本立刻减半”的可靠证据——很多宣传数字来自聊天问答、单次补丁生成,或与完全不做上下文管理的弱基线比较。以下数字均为论文/官方作者报告,未复跑。
持续观察式工作记忆 - Mastra Observational Memory
- 机制:新增交互经后台 Observer 持续追加观察记录;主模型上下文 = 观察记录 + 最近原始交互;观察记录过大时由 Reflector 整理
- 与“上下文满了再让另一个模型总结一次”的实质差别:新进展持续写入而非攒到大阈值;历史尝试、失败与冗长输出转为当前有效的事实与状态;原始交互仍可按观察组回查;缓冲观察先在后台生成再集中激活,激活之间保持前缀稳定——不是永远不破缓存,激活新观察、反思重写时仍会改变前缀
- 证据与边界:LongMemEval-S 上 GPT-4o 回答模型约 84.2%,其他模型配置最高约 94.9%(作者报告);有真实 TS 实现、后台缓冲与恢复机制;主要证据是跨会话聊天记忆问答而非修代码;Observer/Reflector 额外调用成本不可忽略
- 判断:若目标是改善长会话后半段的方向感(减少反复调查、不忘已作决策),比继续调裁剪阈值更有潜力——它改变上下文的组织方式,而不只是长度
任务感知块级抽取 - AttnCompress / Paritok
- 共同思路:不让模型自由改写全部历史,而是按当前任务从代码、日志、工具结果中选择值得保留的原文块——同一个文件对不同问题保留不同内容(调缓存问题保留缓存键、失效分支和调用链,而非全部函数签名)
- AttnCompress 论文:Qwen3-4B 注意力代理模型给内容块打分,保留近期原文,周期性重新评估旧内容。SWE-bench Verified 200 个测试实例(Trae-Agent,三种主模型):
指标 | 完整历史 | AttnCompress |
平均累计输入 | 1118.16K | 644.66K,减少 42.3% |
平均总成本(含压缩开销) | $0.1189 | $0.0949,减少 20.2% |
平均解决率 | 55.17% | 53.17% |
- 关键反例:Qwen3-Coder-30B 五次重复实验总成本 $0.0563 → $0.0566 基本没省,解决率 44.1% → 43.7%——证明的是有竞争力的权衡,不是无损省钱;主模型可继续用闭源 API,但注意力代理需自行运行(普通推理 API 不提供所需注意力);未定位到可直接使用的官方公开实现
- Paritok-4B 论文 · 仓库与权重:针对 coding-agent 内容训练的 4B 压缩器,带原文恢复工具。输入保留 27.8%;SWE-bench Lite 未压缩 122/300 → 压缩后 109/300;补丁应用失败 5 → 16;评测是给定目标文件后的单次补丁生成,没有多轮调查、重读和编辑循环;论文的 p=0.079 只能说“未检出显著退化”,不能证明无质量损失
- 判断:值得借鉴任务感知选择机制,不建议把压缩网关透明插在 OMP 前面。更合适的约束是模型只选原文区间、引擎原样取回,不能重写代码、行号和编辑锚点;优先处理长日志和探索性输出,近期编辑依据保持原样
Agent 自主整理上下文 - ACM / AgentFold
- 代表:ACM 论文 · ACM 源码/数据/模型 · AgentFold
- 核心变化不是摘要格式而是控制权:agent 发现探索阶段结束或陷入死胡同时,主动调用上下文管理工具;压缩内容映射到外部原始记录,后续按需查询;训练时同时学习“什么时候该压、什么时候不该压”
- ACM 的 SWE-bench Verified(同一 Qwen3.5-9B):
配置 | 解决率 | 平均峰值上下文 |
ReAct | 48.9% | 59K |
加 ACM 工具,未专门训练 | 50.8% | 46K |
ACM 专门训练后 | 53.0% | 50K |
- 整理时机可能影响解题能力,而不仅是 token 数;但收益部分来自训练——不能给 Claude/GPT 多加一个 fold 工具就宣称复制训练后的结果。AgentFold 的多尺度折叠有启发,公开实现与训练复现条件不如 ACM 完整
- 判断:上限较高的研究方向,但对依赖多个第三方 API 模型的 OMP 确定性低于外置观察者/抽取器;适合可选实验,暂不把记忆管理完全交给主模型
上下文作为外部数据 - RLM / Volt
- CodeQA 上 GPT-5 摘要代理 58% / $1.31,RLM 62% / $0.11(作者报告);但这是大型代码库问答,不是持续修改、跑测试、修错误的完整编码任务,尾部成本与耗时波动明显
- 对 OMP 增量没表面大:eval、subagent、workpool、artifact 已覆盖同类需求;值得借的是工作流约束——批量论文、海量日志、整仓审计场景把全文留在外部,主线程只收证据与结论,适合做专用“大资料分析模式”,而非替换日常 agent 循环
用后续行为优化压缩策略 - ACON / TRACE
- 方法:在真实压缩边界恢复相同环境状态,分别给 agent 压缩前/后的上下文让它自由继续执行,按新增失败、重复读取和最终完成情况反向优化压缩策略——不是再手写一份“更好的摘要提示词”
- TRACE 在 AppWorld 把已有压缩提示的平均成功率 71.4% 提到 77.1%,但该组未压缩基线为 85.7%,仍有明显差距;TRACE 仓库当前声明无许可证,不能当宽松开源项目复制代码
- 用途:筛掉“看起来压得很好、实际导致多跑十轮”的方案;TRACE 还明确区分边界筛选与完整任务验收
- 另看过 ACE、Recuris 的经验/工作记忆自优化——改变的东西更多,与 OMP 的 skills、长期记忆存在重叠,暂不把成绩简单归因于上下文压缩
选型与最小验证
目标 | 优先候选 | 不应期待什么 |
长会话后半段更稳定、少忘决策 | Mastra 式持续观察工作记忆 | 尚无强 coding 证据保证提升 |
降低长日志、代码探索的输入量 | 任务感知块级抽取 | 压缩率不能直接换算成账单降幅 |
海量资料与整仓分析 | RLM 式外部上下文工作流 | 对已有 eval/subagent 的 OMP 不是全新底座 |
自动学出更好的整理时机 | ACM 式主动管理 | 训练后的收益不能移植给任意 API 模型 |
- 若只选一个先投入:持续观察工作记忆的隔离实验;任务感知抽取作为另一条对照,而非马上大改会话引擎
- 最小验证:从真实长编码任务挑代表性边界(定位结束、进入修改、测试失败、用户改变要求),在相同仓库与环境状态下分别用当前 OMP、观察工作记忆、块级抽取继续执行;先观察接下来几步是否增加无效重读、重复失败、遗漏约束,通过筛选后再跑包含多次压缩的完整任务;计入所有辅助模型、恢复调用、缓存读写、额外轮次和耗时——不能只把同一份旧 transcript 重新计 token,就声称 agent 更省;调策略的任务和验收任务分开,小样本可淘汰坏方案,不能证明细小的质量损失不存在
- 反证要保留:The Complexity Trap 在真实 SWE-agent 编码实验里发现,简单遮蔽旧工具输出就能与 LLM 摘要竞争、成本减半——新架构必须击败当前 OMP 和简单基线,而不是只击败“什么都不做”

![[2026.9.12]待进一步考察实用价值的AI前沿技术](https://www.notion.so/image/attachment%3Ae4deb008-fda7-44bf-8675-41e036cd0133%3AKonachan.com_-_397960_aliasing_animal_aqua_eyes_aqua_hair_bird_bow_gloves_hat_kazunehaka_original_shirt_snow_suit_winter.jpg?table=block&id=330ca147-5df8-8032-b6cb-d25120e23929&t=330ca147-5df8-8032-b6cb-d25120e23929)

























