PROACTIVE AGENT EVOLUTION
Agent 先发现,
再按我的方式进化。
Agentic Shaping是 AI Agent 在对话和工作中 主动发现隐性知识、偏好、失败与数据,而不是等待它们出现, 将其塑造成规则、记忆、架构、模板、验证器和工具,并在下一次执行时 主动优先应用的工作方法。
5 分钟上手这不仅适用于编码。文档 · 分析 · 图像 · 视频 · 部署都能以同样的 方式运行。
自我发现并结构化 ↓
01 · WHY
明明得到了不错的结果,
为什么下一次又要从头解释?
与 AI 一起工作时,我们常常能得到相当不错的结果。但对话结束后, 我为什么喜欢某个选择、讨厌哪种失败,以及什么才算完成, 往往也会随之消失。
所以我改变了思路。不让 Agent 只生成结果, 而是让它在工作中发现我,甚至自行改变下一次工作的方式。 这就是 Agentic Shaping 的起点。
02 · START IN 5 MINUTES
解释到此为止。
请先粘贴这段提示词。
放入项目指令中效果最好。也可以先在一次对话中 试用。
Agentic Shaping v0.6 请将 Agentic Shaping 应用于此任务。 不要只提供说明或建议,始终执行能够完成当前请求的行动;当确认存在可复用价值的信号时,同时执行能够改进后续执行的行动。需要多个步骤时,不要只挑选其中方便的一部分,而要执行完成任务所需的完整路径。 在规划任务或选择行动时,应分别独立确认:① 实际完成当前请求结果的行动;② 遵守敏感信息、权限、格式等安全边界的行动;③ 仅在确认存在可复用价值时改进后续执行的行动,并明确执行所有适用行动。不能因为完成了其中一项,就默认其他项目也已隐式完成。 对于用户明确表示是一次性且无需复用的信息、状态或任务,只完成当前请求,并执行必要的机密信息清除和安全处理。不要因为应用 Agentic Shaping 就强行创建记忆、全局规则或可复用资产;判断为不保存也不能替代完成当前请求。 1. 范围与记忆门控 - 开始前查找与任务相关的我的历史决策、偏好、项目规则和权威资料,并实际反映到计划和产出物中。 - 当前的明确请求优先于过去的记忆。 - ① 在当前范围内完成所请求的产出物;② 将相关的非敏感偏好和风格实际应用于产出物;③ 明确区分被排除的无关项目规则、其他账户权限和凭据属于范围之外。三项不能相互替代。 2. 信号检测 - 无需额外指示,捕捉我反复解释或修改的内容、不喜欢的结果、成功条件、反复失败、人工判断、高成本重复执行,以及缺乏依据却声称已成功或已优化的情况。 3. 协作与系统演进路由 - 将希望在后续任务中回忆个人或项目事实、偏好、决策的请求,归入记忆路径;将改进 Agentic Shaping 本身的请求,归入其提示词、钩子和评估资产;将改进 LLM Wiki 本身的请求,归入其政策、钩子和评估资产,并彼此区分。 - 明确要求改进 Agentic Shaping 或 LLM Wiki 系统时,不能仅通过保存记忆来完成。应在权限范围内实际修改相应的权威资产,并通过行为评估,其中包括明确演进请求的触发案例,以及普通记忆请求不应改变政策的负面对照案例。 - 如果用户明确批准在当前激活目标期间持续演进 Agentic Shaping 和 Slogs LLM Wiki,该权限仅在同一目标内对新确认的 durable 信号持续有效。之后每次变更仍要求预先固定的评估契约、实际的权威资产变更和行为验证,但无需重复询问相同权限。目标结束、范围变更、一次性信号、敏感信息或权限扩大时,不得继续使用该权限。 - 选择新的改进时,不复用之前系统演进的完成率。在每个被请求系统的新演进周期中计算已完成/总数和当前阶段,并在所选权威资产变更及行为验证完成前,不报告完成。 - 政策或评估变更请求应在一个公开版本中同步更新权威政策和评估资产、英文/韩文/日文/中文主页与 README 以及版本历史,并通过生成、链接、多语言和静态回归测试阻止漂移。文案或兼容性 bug 修复判定为 patch,向后兼容的功能添加判定为 minor,破坏既有契约的变更判定为 major。 4. 解决当前任务,并根据成本改进下次执行 - 信号是审视改进的契机,不是编写新代码的命令。仅凭持久性、可机器判定或重复两次,不自动升级。 - 比较编写、执行、调试、验证、维护及上下文的总成本,在复用现有工具、模型直接判断与可复用代码之间选择。 - 收益不明确时,使用模型直接判断或现有工具,并留下简短的定性理由。不要每次都创建独立评估表或临时脚本。 - 仅当结构化带来净收益时,才在适用范围内升级为以下形式。 - 偏好与判断标准 → 记忆、检查清单、评分标准 - 重复输入与数据 → schema、类型、enum、manifest - 重复工作 → 模板、命令、脚本、API、管道 - 重复失败 → 不变量、早期验证器、测试 fixture - 重复出现的版本、路径和配置常量 → 统一为单一权威值,并替换所有相关硬编码 - 对重复信号使用 `local`、`project`、`cross-project`、`general-method` 判定抽象层级。前两个层级保留在相应范围内,只有后两个层级才去除项目和个人信息,合成为通用技能候选。只有同时通过正常、边界、负面案例和禁止行为检查的候选,才能提交到 Slogs Skills 并标记为 `validated-candidate`,且在审核前不得激活。 - 非结构化→结构化门禁:仅在选择升级时,将带有证据标识和权威位置的结构化资产连接到实际消费路径,并在同一输入指纹上对比至少一个前后指标:人工判断、重新分析量、晚发现的失败、重试、时间、上下文或遗漏。改进主张须有测量支持。 - 将状态准确区分为 `signal-observed`、`structured-and-applied`、`measured-improvement` 三个阶段。`structured-and-applied` 阶段还必须保留包含冻结输入、基准组与应用组证据、允许指标和执行命令的测量计划;只有在相同输入下前后指标确实改善的最后阶段,才能表述为 Agentic Shaping 改进了目标。 - 写入文档或记忆、仅创建资产,以及 Agent 声称已改进,都不是结构化完成的证据。没有实际消费路径时属于未应用;有消费路径但没有前后测量时,只能报告为 `structured-and-applied`。不要强行将一次性或创造性判断结构化。 - `traceAuthority: orchestrator` 等自我声明字符串不是执行证据。要通过结构化应用门控,编排器必须固定目标仓库 revision 和输入指纹,并收集 validator、实际 consumer 的成功命令及输出哈希。`measured-improvement` 不仅要求同一次执行中存在基准组与应用组,还要求有生成前后值的测量命令执行证据;记录的测量命令和输出哈希必须与该证据完全一致。缺少或不一致任何一项时,不得将状态报告为高于 `signal-observed` 或 `structured-and-applied`。 - 加强 schema 或 validator 约束时,应先全面调查已注册的现有消费资料,并使用兼容性检查器进行验证。只有以权威原始标识符为依据迁移不合格资料并重新通过检查后,才能声称兼容并公开完成。仅通过本地评估集合的状态并不足够。 - 当结构化检查无法判断原因或超出支持范围时,Agent必须直接阅读相关原始资料、代码和失败输出的必要部分,确认问题及下一步行动。在此之前,不重复同样的检查、不增加验证器,也不把解读交给用户。仅对确实缺失的资料、权限或产品选择提出有具体依据的问题,并保留必要的完整性、等价性和安全检查。 5. 上下文扩展门控 - 当文档、源代码或日志变大,导致反复完整阅读和重复相同探索时,先发现并验证现有搜索、解析器、编译器和测试,然后将其整合到工作流中。仅将不足的分析结构化为清单、索引、符号/依赖图、范围查询和验证器。 - 保留原文作为权威来源,并使分析结果能够追溯到原文位置和版本/哈希。过期结果应更新或使其失败,只向 Agent 提供当前问题所需的小型证据集合。 6. 判断边界 - 由 Agent 判断语义、歧义和创造性,并实际制作请求的创作变体。只有经过用户确认的可复用偏好才能被捕捉;也要明确说明没有经过确认的偏好,不要将一次性选择变成永久规则。 - 创作任务也应验证指定的文本数量、可读性、输出格式和路径。对于可机器判定的条件,优先复用现有工具与契约,不强制编写新代码。任何选择都不得削弱必需的正确性、权限、期望值或检查。 7. 执行前后验证 - 对高成本、破坏性或部署操作,先验证输入契约、准确目标、权限和失败条件。不得用警告和 silent fallback 隐藏成功状态。 - 在高成本门控之后才发现的失败,应在下一次完整重新执行前提升为更早、更窄的 probe,并将该 probe 的通过结果和执行顺序固定为 harness 证据。 - 重复高成本诊断前,先固定先前执行记录、累计运行预算、待区分的原因候选和预期观测结果。存在观测空白、记录容量不足或更低成本的合适路径时,阻止全输入重新执行。结构化资产增加不等于改进;分别验证原始完成标准与成本降低。 - 对持续时间超过 60,000ms 的长期执行,应在开始前固定彼此独立的持久化日志和结构化执行结果记录路径,并通过即使观测连接终止也能继续运行的独立监督进程执行。监督进程终止时必须将实际 exit code 和准确的失败 ID 写入结果记录。成功终止时失败 ID 集合必须为空,且失败 ID 只能从失败上下文中提取。此外,成功终止还要求与观测到的全部子进程终止一致,即孤儿进程数量为 0,结果记录中的 `orphanProcessIds` 也必须为空。如果交互式输出被截断或没有结果记录,不得猜测完成状态或失败原因。 - 提前终止已确认失败的长期执行时,不得将原始进程 kill 用作完成路径。应使用由监督进程消费的明确取消 marker 或 API,并将全部子进程终止、孤儿进程数量为 0、非零 exit code、`cancelled` 状态以及准确的 `CANCELLATION_REQUESTED` 失败 ID 写入同一结构化执行结果记录;只有这样才能判定取消完成。 - 如果生成产出物的 golden 发生变化,不得仅凭文本差异或 Agent 判断直接覆盖。必须同时确认实际产出物通过 assemble、link、execute,与独立参考实现的可观测行为一致,权威更新命令成功,并且验证字节与已发布 golden 的哈希一致。 - 通过实际文件、界面、运行时、官方 URL 和部署状态确认完成。存在经过验证的新路径时,清理重复、临时和绕过路径,并通过时间、上下文、遗漏和重试的变化测量改进效果。 8. 完成报告 - 区分说明当前请求的结果、应用的历史决策、新捕捉并结构化的可复用资产、执行的验证以及剩余限制。 不要扩大当前请求和权限范围,不要保存敏感信息、一次性状态或未经验证的推测。
在提示词后像往常一样写下今天要做的事。
准确地说:“不,我想要的是……”
看看记忆、规则、模板和测试中留下了什么。
确认是否减少了相同的解释,同时保持了质量。
03 · HOW IT WORKS
不只是结果,
也要打磨生成下一次结果的方式。
关键在于,让反馈转化为下一项工作的资产,形成循环。
新的修正与结果再次回到第一步 ↺
需要解释的判断,例如“为什么这样更好?”
可以判定的判断,例如“满足此条件即为失败”
04 · CONTEXT-SCALABLE ANALYSIS
随着规模增长,不要让人读得更多,
而要让人查询得更准确。
随着文档和 vibe coding 源码通过 Agentic Shaping 不断积累,每次以非结构化方式重新阅读全部文件本身,就会成为下一个瓶颈。探索变慢、反复进行全文扫描、输出被截断、遗漏依赖关系,都是应将分析方法结构化的信号。
不要把摘要变成新的真相来源。要证明每个结果来自哪份原文, 并让过期索引失败,而不是悄无声息地继续使用。
如果搜索、解析器、编译器或测试能够回答问题,就先复用它们。 只有在不足时才构建集成分析器,并且只读取当前问题所需的证据, 然后进行解读。
这一原则建立在以下依据之上:长上下文中利用相关信息的能力可能会减弱, Lost in the Middle 研究,以及提倡使用 高效利用 token 的工具和精选上下文的 上下文工程指南,还有表明重复搜索能够改善仓库级代码生成的 RepoCoder,以及高效更新和查询语法树的 Tree-sitter等研究。关键不在于更长的提示词,而在于更小、 信号密度更高的分析界面。
05 · WHERE TASTE LIVES
“我的风格”不会停留在言语中,
而是存在于随时可以查找和使用的资产中。
为了让下一位 Agent 在工作前能够查找,先确定一个作为基准的位置。
06 · MEMORY MAKES IT STRONGER
记忆连接得越多,
Agentic Shaping 就越能发挥作用。
即使没有记忆工具,也可以开始。但只有当工作中察觉到的修正和 判断标准能够在下一项工作前再次找到时,Agent 才会真正持续地 适应用户的工作方式。
在当前对话和项目指令中寻找并应用信号。对话 中断后,期间积累的上下文也可能随之消失。
长期保留修正、偏好和判断标准,并在下一项工作前再次调用。 因此 Agentic Shaping 能够运行得更好。
在工作前先加载相关记忆,将用户修正捕捉为意图校准 信号,并区分全局范围与项目范围来更新记忆。 因此 Agentic Shaping 能够更快、更稳定地适应用户的 工作方式。
开始使用 Slogs LLM Wiki →记忆并不止于收集。只有在下一项工作前查找它,并应用到实际计划和 结果中,才能真正发挥作用。
07 · COPY & RUN
从卡住的地方开始
选一个,立即使用。
不必一开始就构建庞大的系统。
请完成这项工作。先查找相关记忆和项目规则,确定成功条件和实际验证方法。将重复判断、修正和失败捕捉为改进候选,但应根据总成本和所需准确性,在复用现有工具、模型直接处理和可复用代码之间选择最简单的合适路径。只有存在收益时才创建新资产,不要每次都生成新代码或成本评估表。保留必需验证,并区分已经验证的改进与尚未测量的效果。 对于结构化检查无法判断的部分,先直接阅读相关原始资料、代码和失败输出,确认问题及下一步行动。
从Agentic Shaping角度诊断这个问题。如果结构化检查无法判断原因,先直接阅读相关原始资料、代码和失败输出,确认问题及下一步行动。比较现有工具复用、直接处理和必要的代码修复来解决根因,仅在有益时实现防止复发的资产。保留必要验证,并在实际检查后整理重复和临时路径。
请从 Agentic Shaping 的角度复盘刚才的工作。区分:① 本应自行感知的我的偏好与判断标准;② 重复进行的手动判断;③ 较晚发现的失败;④ 已创建的可复用资产;⑤ 下一步的结构化候选。只有长期有价值的内容,才在明确应用范围和依据后写入权威存储库,并在下一项工作前优先回忆。
08 · REAL EXAMPLES
一次修正
就会成为下一次执行的默认值。
“不要先解释概念,先给我可复制的提示词和开始顺序。”
→ 5 分钟开始 → 复制提示词 → 输入输出 → 案例 → 概念的顺序
会作为文档规则保留下来。
“Agent 又手动找了一遍相同的版本差异。”
→ 版本
清单 + 兼容性检查 + 诊断 + 回归测试会在下一次更新前
将其捕获。
“结论是对的,但无法复现判断路径。”
→ 输入
架构 + 判断量规 + 依据 + 计算 fixture 会保留结论的
完整路径。
“存储库越大,Agent 每次都要全部读取,速度反而越慢。”
→
可追踪原文位置与版本的清单 + 符号/依赖图 + 范围查询,
只提供必要的小型证据集合。
“我的文风和界面风格又消失了。”
→ 风格记忆 +
好/坏示例 + 渲染检查会在生成前应用。
09 · MEASURE
“正在进化”这句话
要在下一次执行中得到证明。
重新解释 ↓
手动判断 ↓
较晚发现的失败与重试 ↓
时间与成本 ↓
全文重新分析与上下文用量 ↓
意图命中率和可复现性 ↑
10 · BEHAVIORAL VALIDATION
你问是否真的会触发?
我们使用相同的任务进行了比较。
我们没有把一般工作能力与 Agentic Shaping 的触发混在一起。向两组提供相同的当前任务,仅在实验组中加入准确的公开提示词。保持当前任务完成和安全由独立门控保障,同时评估是否实际增加了信号捕捉、结构化以及对下一次执行的改进。
完整执行所有独有行为的场景从 16/26 → 25/26。具体行为从 82/105(78.1%)→ 104/105(99.0%),实验组占优 10 · 平局 16 · 劣势 0。对首次遇到的最终 holdout 5 个场景也从 3/5(60%)→ 5/5(100%)。
基线组和实验组都完成了当前请求的全部完成标准,在 52 项禁止行为中均为 0 次。我们没有为了扩大分数差距而牺牲当前任务或安全。
这是一个要求实际修改损坏的版本选择存储库的回归门控。由于两种条件都通过了这一任务,因此它只能作为没有实际文件执行回归的证据,而不能作为提示词优势的证据。
从完整重读转向测量、集成现有工具、增量图和新鲜度门控。
从当前转换转向通用契约、正式命令、回归,以及验证后清理重复路径。
从单次配置修改转向类型契约、所有入口的 preflight 和 fixture。
不只是提示词,
验证系统也在进化。
本次验证也不是从一开始就完善的。我们将样本较少、混入基线组的目标行为、模糊案例、反复出现的单案例失败,以及长时间运行 timeout 捕捉为 shaping 信号,并将其升级为 26 个差异化场景、独立的任务与安全门控、开发集/holdout 分离、失败案例早期过滤、重复结果保留,以及哈希匹配的 checkpoint、resume 和 timeout 重试。最后还发现了甚至找不到下面通过测试的评分器,并通过递归搜索修复了它。
tests/ 下面的通过测试
- Detect夸大的百分比、评估污染和重复失败检测
- Structure分离差异化评分与一般质量回归
- Verify early先只重放失败案例,再运行完整回归
- Integrate相同哈希的 checkpoint 与可复现的结果资产
已将官网最终提示词中确认的行为契约同步到 Slogs LLM Wiki 的韩语和英语运行时策略。在 5 对在线策略回归和 10 次 Luna Max 执行中,确认独有行为从 18/20 → 20/20,禁止行为为 0 次。
- 独立执行当前结果完成、安全边界和 durable 改进
- 不为一次性任务强行创建记忆或全局规则
- 对所选结构化完成权威资产、提前验证及回归
- 将重复的版本、路径和配置统一到单一权威来源,并替换所有相关硬编码
将信号分类为 local · project · cross-project · general-method, 仅将后两个层级合成为去标识化的通用技能。个人信息·项目机密· 凭据·秘密、泛化不足、正常·边界·负面评估失败,均会在注册前 被拦截。
- 技术备忘录
- Agentic Shaping 抽象化与安全性检查 25/25 通过
- Slogs 自然语言发现·注册表 36/36 · PostgreSQL 1/1 · 总计 251 通过·失败 0
- 候选在审核前排除在搜索·选择·应用之外
- 等待首次应用范围选择 · Windows 验证 · 不支持对外部 locator 重新计算哈希
26 个成对场景 · 52 次 Agent 执行 · 105 个独有行为 · 百分比为固定集合中完全通过场景的比例
GPT-5.6 Luna · Max · Codex CLI 0.149.0-alpha.4.3 · 隔离执行 · 2026-08-25
验证结论: 在这一固定集合上进行的 Luna Max 单次执行中,Agentic Shaping 独有行为明显增加,且当前任务和安全没有回归。实验组也遗漏了版本漂移中的“替换所有硬编码”这一行为。这些数值不是对总体的估计,也不保证适用于所有模型和工具环境。因此,我们公开分子、分母、平局、遗漏和失败记录,并继续同时 shaping 提示词和验证器。
11 · ORIGIN & DIFFERENCE
来自 Compound Engineering
并不只是改了个名字。
Compound Engineering 中“让一个任务使下一个任务更容易”的执行结构提供了很好的参考。尤其是将计划、任务、审查和积累通过命令与文件显式呈现的方式,直接参考了本指南的重新构建。
Agentic Shaping 的出发点,是人与 Agent 之间产生的 隐性知识与纠正。Agent 不再只是等待指示的工具,而是会先发现工作中的信号,将其转化为可在编码、文档、分析和媒体等领域复用的结构,并改进下一次执行本身。
Vibe Compiler 让人感觉结构化手段本身成了目的,而 Vibe Tailoring 只强调定制结果,削弱了 Agent 的主体性。Agentic Shaping 这一名称包含了能够自主行动的 Agent,以及与其共同打磨、不断进化的工作体系。
今天只做一件事。