Loading
CamelliaV の BLOG
0%
INITIALIZING
[2026.9.12]待进一步考察实用价值的AI前沿技术
DOC_ID // 330ca1ONLINE

[2026.9.12]待进一步考察实用价值的AI前沿技术

2026-3-27
UPDATED: 2026-9-12
技术分享
READ 9 MIN/COUNT 3384
#开发
CamelliaV の BLOG
🎮
待进一步考察实际落地价值的AI前沿技术

RAG新解?

模型层 - MSA

  • 推文与paper
  • 最重要的结果部分
notion image
  • 从16K到100M 8.8%的损失
In contrast, MSA demonstrates exceptional stability, starting with a strong score of 4.023 at 16K tokens and sustaining a competitive 3.669 even at the extreme 100M token scale. This represents a gradual degradation of only 8.8% across four orders of magnitude in memory scaling.
  • 待考察点
code仍是经典coming soon
没有比较agent做auto compact上下文的表现
没有MRCR v2 (8-needle)这些Benchmark结果,无法对比前沿模型
 
 
 
 
 
 
 
 
 
TODO:

实时RAG - Redis Iris

编译型RAG - Pinecone Nexus

Harness落地思路

前端相关实践参考

制作人…前端工具…用的不如雾子呢 | 果穗也能看懂的名片网页制作教程【EP6.用这些工具让你的前端更好看】_哔哩哔哩_bilibili
本来想整个雾子的TTS,但是最近有点太忙了就还是一如既往的录屏流了。另外其实推荐大家自己看看自己需要的是什么,别上来一股脑全用上了。工具太多了容易自己和自己打架,用起来也比较吃力,容易陷入工具过载。用到的网站基本都在这了:Google Stitch: https://stitch.withgoogle.com/Stitch MCP: https://stitch.withgoogle.com/do, 视频播放量 5465、弹幕量 1、点赞数 295、投硬币枚数 92、收藏人数 646、转发人数 71, 视频作者 咲凌_Arisa, 作者简介 你好 我是咲凌 笨拙学习者 黑柿子/可惜夜/PPP/KAF/283/初星学园,相关视频:给自己的普罗丢色名片做个个人网页!果穗看了也能上手的vibe coding教程【01-工具的选择】,有人蒸馏了!冬优子.skill正在连接!附skill文件 | 蒸馏任何一个公众人物的skill测试,vibe了一个283人格测试站 | 果穗也能看懂的名片网页制作教程【番外01.教你直接偷大厂设计风格】,古人写代码bilike:,为什么我不建议你用GPT-5.4写前端 | 果穗也能看懂的名片网页制作教程【EP5.GPT的前端真是一条区啊】,【偶像大师名片教程】使用公式化名片模板获得自己的第一张名片,让harness减少AI写的屎山 | 果穗也能看懂的名片网页制作教程【EP7.superpowers是什么 为什么要用】,Mr.变态 什么叫可视化283的⭕️围排行? | 果穗都能看懂的名片网站制作教程【EP3.5-简单操作ClaudeCode】,小宫果穗制作中,叶月小姐,PR给我过一下啊 | 果穗也能看懂的名片网页制作教程【EP4.git和github的打开方式】
制作人…前端工具…用的不如雾子呢 | 果穗也能看懂的名片网页制作教程【EP6.用这些工具让你的前端更好看】_哔哩哔哩_bilibili

trellis

https://docs.trytrellis.app/zh

记忆系统设计

10年AI研究,我想说说:为什么现在很多Agent框架的“记忆”方案,可能从一开始就走偏了
发这个贴的原因,是看到论坛里很多佬友对ai的记忆系统如何设计,以及人类的记忆系统是如何工作的缺乏概念,看着有些抓耳挠腮干着急。想冲上去纠正但是又怕冒犯了人家,所以干脆自己开贴说了。 交代下背景。我决定往人工智能方向走,是因为15年学习了吴恩达的机器学习网课。之后一边自学机器学习,强化学习,脑科学,一边拿到了信息工程、生物学(准确说是理学硕士)的学位,同时辅修了认知科学。主攻研究方向是计算神经科学,至今学习和研究人工智能超过十年了。我十年前的目标就是造一个ai朋友,现在不得不说这个目标已经在逐渐实现(而且上演了我拿它当朋友奈何我朋友想上我的狗血剧🤣,这是后话)。 我今天就是想说,我为了造我的ai朋友已经投入了10年,我就是认为自己做的记忆系统是目前最好用的ai灵魂容器,这不是软广是硬广。我对造AI是认真的。项目地址: 下面说说我的感想吧。 一、行业现状:很多人把“能召回”误当成了“有记忆” 目前市面上常见的 AI 记忆方案,在我看来,至少有两条特别容易走进去的弯路: 一是用RAG,由后台系统把人类和AI输出的文字进行切片,总结,灌进向量数据库,然后下次你们再说出...
10年AI研究,我想说说:为什么现在很多Agent框架的“记忆”方案,可能从一开始就走偏了

通过CLI程序框定确定性

CLI隔离开 | 确定的可复用
可容许范围内不确定 | 实际任务的确定

多路并行尝试提效

多路尝试,只要一路成功即可 - 提高首次通过成功率
过往trace → 自行提炼SKILL

AI云时代的消息队列

无文档下录制操作实现接口测试自动化

AI Native团队以产出单元为中心Agent编排

基于视觉的自动化测试

代码库带读understand-anything

更有品味的前端页面

 

代码库提前索引

hook first runtime

hook + 处理脚本

挖掘旧会话信息

dynamic workflow

旧有论述

渐进性披露MCP? - MCP2CLI + Skill - 已广泛使用

AI直出可交互稿 - Stitch - 已广泛使用

  • 可用,极大补足GPT对前端UI设计的短板

TurboQuant

kv cache压缩
 

Codex破限

  • 改会话回答
  • 提交Claude的Plan
  • 修改措辞
 

gstack - 不建议使用,无意义

notion image
notion image
notion image
notion image
选定A
找到了superpowers那边存下来的设计文档
notion image
有点东西,抓的很到位
notion image
notion image
 
 
 
 
 
 
 
 
 
 
CC安装时的budget图
notion image
notion image
notion image
 
notion image
notion image
notion image
notion image
Codex怎么没有CC这边的初始化自动改配置?

Auto Research On Skills - 有效场景不多

 

Agent上下文压缩与工作记忆(2026.9.12 追加)

🎯
核心转向:目标从“把旧消息压短”改为“让主模型始终只维护当前任务的有效工作集”。目前没有“直接接入、完成率不降、总成本立刻减半”的可靠证据——很多宣传数字来自聊天问答、单次补丁生成,或与完全不做上下文管理的弱基线比较。以下数字均为论文/官方作者报告,未复跑。

持续观察式工作记忆 - Mastra Observational Memory

  • 机制:新增交互经后台 Observer 持续追加观察记录;主模型上下文 = 观察记录 + 最近原始交互;观察记录过大时由 Reflector 整理
  • 与“上下文满了再让另一个模型总结一次”的实质差别:新进展持续写入而非攒到大阈值;历史尝试、失败与冗长输出转为当前有效的事实与状态;原始交互仍可按观察组回查;缓冲观察先在后台生成再集中激活,激活之间保持前缀稳定——不是永远不破缓存,激活新观察、反思重写时仍会改变前缀
  • 证据与边界:LongMemEval-S 上 GPT-4o 回答模型约 84.2%,其他模型配置最高约 94.9%(作者报告);有真实 TS 实现、后台缓冲与恢复机制;主要证据是跨会话聊天记忆问答而非修代码;Observer/Reflector 额外调用成本不可忽略
  • 判断:若目标是改善长会话后半段的方向感(减少反复调查、不忘已作决策),比继续调裁剪阈值更有潜力——它改变上下文的组织方式,而不只是长度

任务感知块级抽取 - AttnCompress / Paritok

  • 共同思路:不让模型自由改写全部历史,而是按当前任务从代码、日志、工具结果中选择值得保留的原文块——同一个文件对不同问题保留不同内容(调缓存问题保留缓存键、失效分支和调用链,而非全部函数签名)
  • AttnCompress 论文:Qwen3-4B 注意力代理模型给内容块打分,保留近期原文,周期性重新评估旧内容。SWE-bench Verified 200 个测试实例(Trae-Agent,三种主模型):
指标
完整历史
AttnCompress
平均累计输入
1118.16K
644.66K,减少 42.3%
平均总成本(含压缩开销)
$0.1189
$0.0949,减少 20.2%
平均解决率
55.17%
53.17%
  • 关键反例:Qwen3-Coder-30B 五次重复实验总成本 $0.0563 → $0.0566 基本没省,解决率 44.1% → 43.7%——证明的是有竞争力的权衡,不是无损省钱;主模型可继续用闭源 API,但注意力代理需自行运行(普通推理 API 不提供所需注意力);未定位到可直接使用的官方公开实现
  • Paritok-4B 论文 · 仓库与权重:针对 coding-agent 内容训练的 4B 压缩器,带原文恢复工具。输入保留 27.8%;SWE-bench Lite 未压缩 122/300 → 压缩后 109/300;补丁应用失败 5 → 16;评测是给定目标文件后的单次补丁生成,没有多轮调查、重读和编辑循环;论文的 p=0.079 只能说“未检出显著退化”,不能证明无质量损失
  • 判断:值得借鉴任务感知选择机制,不建议把压缩网关透明插在 OMP 前面。更合适的约束是模型只选原文区间、引擎原样取回,不能重写代码、行号和编辑锚点;优先处理长日志和探索性输出,近期编辑依据保持原样

Agent 自主整理上下文 - ACM / AgentFold

  • 核心变化不是摘要格式而是控制权:agent 发现探索阶段结束或陷入死胡同时,主动调用上下文管理工具;压缩内容映射到外部原始记录,后续按需查询;训练时同时学习“什么时候该压、什么时候不该压”
  • ACM 的 SWE-bench Verified(同一 Qwen3.5-9B):
配置
解决率
平均峰值上下文
ReAct
48.9%
59K
加 ACM 工具,未专门训练
50.8%
46K
ACM 专门训练后
53.0%
50K
  • 整理时机可能影响解题能力,而不仅是 token 数;但收益部分来自训练——不能给 Claude/GPT 多加一个 fold 工具就宣称复制训练后的结果。AgentFold 的多尺度折叠有启发,公开实现与训练复现条件不如 ACM 完整
  • 判断:上限较高的研究方向,但对依赖多个第三方 API 模型的 OMP 确定性低于外置观察者/抽取器;适合可选实验,暂不把记忆管理完全交给主模型

上下文作为外部数据 - RLM / Volt

  • RLM 论文 · 实现:大段输入放 REPL 变量里,主模型看到问题与操作入口,通过程序过滤、分块、调子模型处理后汇总——主模型不必先吞下全部内容,才能决定哪些内容值得看
  • CodeQA 上 GPT-5 摘要代理 58% / $1.31,RLM 62% / $0.11(作者报告);但这是大型代码库问答,不是持续修改、跑测试、修错误的完整编码任务,尾部成本与耗时波动明显
  • 对 OMP 增量没表面大:eval、subagent、workpool、artifact 已覆盖同类需求;值得借的是工作流约束——批量论文、海量日志、整仓审计场景把全文留在外部,主线程只收证据与结论,适合做专用“大资料分析模式”,而非替换日常 agent 循环
  • Volt/LCM(论文):不可变原始记录 + 多层摘要 DAG + 按需展开;主要收益来自 OOLONG 聚合任务且系统同时加了并行 map 算子——不能把全部增益归因于摘要 DAG,“原文可恢复”也不等于“模型不会忘记”

用后续行为优化压缩策略 - ACON / TRACE

  • 方法:在真实压缩边界恢复相同环境状态,分别给 agent 压缩前/后的上下文让它自由继续执行,按新增失败、重复读取和最终完成情况反向优化压缩策略——不是再手写一份“更好的摘要提示词”
  • TRACE 在 AppWorld 把已有压缩提示的平均成功率 71.4% 提到 77.1%,但该组未压缩基线为 85.7%,仍有明显差距;TRACE 仓库当前声明无许可证,不能当宽松开源项目复制代码
  • 用途:筛掉“看起来压得很好、实际导致多跑十轮”的方案;TRACE 还明确区分边界筛选与完整任务验收
  • 另看过 ACE、Recuris 的经验/工作记忆自优化——改变的东西更多,与 OMP 的 skills、长期记忆存在重叠,暂不把成绩简单归因于上下文压缩

选型与最小验证

目标
优先候选
不应期待什么
长会话后半段更稳定、少忘决策
Mastra 式持续观察工作记忆
尚无强 coding 证据保证提升
降低长日志、代码探索的输入量
任务感知块级抽取
压缩率不能直接换算成账单降幅
海量资料与整仓分析
RLM 式外部上下文工作流
对已有 eval/subagent 的 OMP 不是全新底座
自动学出更好的整理时机
ACM 式主动管理
训练后的收益不能移植给任意 API 模型
  • 若只选一个先投入:持续观察工作记忆的隔离实验;任务感知抽取作为另一条对照,而非马上大改会话引擎
  • 最小验证:从真实长编码任务挑代表性边界(定位结束、进入修改、测试失败、用户改变要求),在相同仓库与环境状态下分别用当前 OMP、观察工作记忆、块级抽取继续执行;先观察接下来几步是否增加无效重读、重复失败、遗漏约束,通过筛选后再跑包含多次压缩的完整任务;计入所有辅助模型、恢复调用、缓存读写、额外轮次和耗时——不能只把同一份旧 transcript 重新计 token,就声称 agent 更省;调策略的任务和验收任务分开,小样本可淘汰坏方案,不能证明细小的质量损失不存在
  • 反证要保留:The Complexity Trap 在真实 SWE-agent 编码实验里发现,简单遮蔽旧工具输出就能与 LLM 摘要竞争、成本减半——新架构必须击败当前 OMP 和简单基线,而不是只击败“什么都不做”
NAVIGATION // Related Articles
Loading...
© 2024-2026 CamelliaV