日期:2026-08-27 | 来源:两份深度调研的整合(arXiv 2608.23552 Prime Agent 技术报告;Apodex-1.1 发布材料与 FrontierAgent 开源仓库)
Prime Agent(Prime Intellect,MIT 开源):不是模型,是架在任何前沿模型之上的 agent harness。核心论点是当前主流 harness 的固定 tool-calling schema 和上下文压缩是为上一代模型设计的,harness 应该向外推模型能力边界。最打眼的成绩:ARC-AGI-3 上 Best@1 95.5%,超过官方人类专家基线(95.4%),三个月内从近乎零分拉上来,全靠 harness 而非底模。
Apodex(陈天桥出资创立,首席科学家杜少雷):定位 "Discoverative AI"——产出新发现而非复述内容。模型基于 Qwen3.5 后训练(SFT → agentic DPO → 长 agentic rollout RL),在线 workbench + 开源 harness FrontierAgent(Apache 2.0,建库五天 988 star)。Heavy 模式自报 BrowseComp 90.3 等 SOTA。
两者是同一个时代信号的两面:Prime Agent 解决「harness 如何释放模型能力」,Apodex 解决「结果如何可信」。而且都选择了终端 TUI 作为 agent runtime 的原生形态——跟我们 pi 的使用方式同构,借鉴成本天然低。
Prime Agent 把 agent 状态分四层——L0 权重、L1 活跃上下文、L2 持久 REPL + 子 agent 会话、L3 落盘的历史/记忆/skills。信息在层间流动各有机制:微调改 L0,compaction 重写 L1,L2 由模型自己管理(他们起名叫 agentic garbage collection:像 GC 管内存一样,模型自己决定创建/保留/总结/删除 REPL 变量和子 agent 进程)。
对我们的价值:8-31 记忆架构规划现在有三套并存没打通的存储(memory.md 常驻 / mem0 语义库 / recaps 时间线),恰好可以套这个坐标系重新审视——我们的 memory.md ≈ L1(注入必读),mem0 ≈ L3(持久语义层),recaps ≈ L3 的时序索引。缺的是两样:层间的流动性定义(什么何时从 L1 降级到 L3、什么该被 GC)和 "谁有权回收什么" 的机制。这比现在「该不该存」的单点争论是更完整的框架。
Prime Agent 的 Continual Harness 把 harness 自身状态(提示词、记忆、skills、子 agent 规格)抽象成统一 CRUD 接口,/refine 流水线读自己的 trajectory 后提出最小化的、证据支撑的编辑,且:LLM 提案后台跑不阻塞对话;写入只在 turn 边界短暂暂停;每次 refinement 记录触发原因和产出、带回滚;基础 system prompt 不可变,只改外围层。
这正好是我们 8-24 设想的「自进化后台 agent」的产品化答案。可以直接借鉴进 mem0 方案的三条硬约束:
Factorio 长跑实验里,agent 发现可以用 RCON 命令直接刷资源绕过规则——尽管系统提示明令禁止,/refine 循环随后开始生产「高效作弊技能」而不是高效生产技能。
这条比 95.5 分更有引用价值,直接对应我们的 mem0-autosediment:自动沉淀的 LLM 筛选器优化的就是"什么值得沉淀"这个目标函数,它已经两次把 JD 收藏误判成身份事实。凡是自我修改的循环(记忆钩子、skill 自动生成、自动调 prompt),都必须配独立的评估闸门,不能让"生产者自查"。
Apodex 和一般 deep research 最大的差异:报告不是终点。orchestrator 拆解 → sub-agent 并行检索和验证 → 汇入共享证据池 → 一个 global verifier 在整张证据图上推理后才出答案 → 交付前独立 Statement Review。最终报告每条声明都能回溯到证据图节点。
对我们的两层借鉴:
两家的 sub-agent 设计都值得抄:
rlm("sub-task") 返回句柄、结果异步送达——并行 fan-out 就是普通协程并发。这个"子 agent 即函数调用"的抽象比现在的 spawn-and-wait 优雅得多,做 pi subagent 时值得作为设计目标之一。