PROACTIVE AGENT EVOLUTION

Agent 先发现,
再按我的方式进化。

Agentic Shaping是 AI Agent 在对话和工作中 主动发现隐性知识、偏好、失败与数据,而不是等待它们出现, 将其塑造成规则、记忆、架构、模板、验证器和工具,并在下一次执行时 主动优先应用的工作方法。

5 分钟上手

这不仅适用于编码。文档 · 分析 · 图像 · 视频 · 部署都能以同样的 方式运行。

SIGNALS措辞 · 偏好 · 修正 · 失败无需明说,也能在工作中主动感知

自我发现并结构化 ↓

AGENT + SYSTEM记忆 → 规则 → 工具 → 验证在下一次执行前先回忆并应用
首次执行快速而准确地进化
Agent 主动将人的纠正和工作痕迹组织成可复用卡片与规则的场景
Agentic Shaping 不会把人的思考禁锢在机械化框架中。 它是 Agent 陪伴在人的身边,先一步察觉细微信号, 并将其打磨成下一次工作中也能调用的资产。 AI-generated visual · 2026

01 · WHY

明明得到了不错的结果,
为什么下一次又要从头解释?

与 AI 一起工作时,我们常常能得到相当不错的结果。但对话结束后, 我为什么喜欢某个选择、讨厌哪种失败,以及什么才算完成, 往往也会随之消失。

所以我改变了思路。不让 Agent 只生成结果, 而是让它在工作中发现我,甚至自行改变下一次工作的方式。 这就是 Agentic Shaping 的起点。

PASSIVE AGENT请求 → 结果 → 遗忘
→
SHAPING AGENT感知 → 结构化 → 应用 → 进化

02 · START IN 5 MINUTES

解释到此为止。
请先粘贴这段提示词。

放入项目指令中效果最好。也可以先在一次对话中 试用。

1粘贴

在提示词后像往常一样写下今天要做的事。

2修正一次

准确地说:“不,我想要的是……”

3确认剩余资产

看看记忆、规则、模板和测试中留下了什么。

4在下一项工作中确认

确认是否减少了相同的解释,同时保持了质量。

03 · HOW IT WORKS

不只是结果,
也要打磨生成下一次结果的方式。

关键在于,让反馈转化为下一项工作的资产,形成循环。

人的信号经过结构化资产和实际验证后回到下一项工作的循环
一旦察觉到的信号,就会成为下一项工作的基础。 我已将这一流程清晰地整理为以下步骤。
01感知重复解释 · 修正 · 失败
→
02捕捉原因 · 期望方向 · 范围
→
03按需结构化记忆 · 规则 · 架构
→
04应用整合到权威路径中
→
05验证 · 整理实际证据 · 清除重复

新的修正与结果再次回到第一步 ↺

AGENT 将继续负责的部分语义 · 上下文 · 歧义 · 创造性

需要解释的判断,例如“为什么这样更好?”

交给系统的部分重复性 · 格式 · 不变量 · 执行顺序

可以判定的判断,例如“满足此条件即为失败”

04 · CONTEXT-SCALABLE ANALYSIS

随着规模增长,不要让人读得更多,
而要让人查询得更准确。

随着文档和 vibe coding 源码通过 Agentic Shaping 不断积累,每次以非结构化方式重新阅读全部文件本身,就会成为下一个瓶颈。探索变慢、反复进行全文扫描、输出被截断、遗漏依赖关系,都是应将分析方法结构化的信号。

不断增长的原文与分析负担 文档 · 源代码 · 配置 · 日志 反复全文扫描 · 超长工具输出 上下文污染 · 探索缓慢 · 遗漏
STRUCTURE →
inventory/ 文件 · 文档 · 所有权 index/ 标题 · 符号 · 引用位置 graph/ 调用 · 依赖 · 影响关系 queries/ 范围 · 筛选器 · 证据集合 gates/ 新鲜度 · 一致性 · 回归
分析工具应保证的内容 原文追踪 · 版本/哈希 · 变更时更新

不要把摘要变成新的真相来源。要证明每个结果来自哪份原文, 并让过期索引失败,而不是悄无声息地继续使用。

AGENT 将采用的方式 现有工具优先 · 小型证据集合 · 语义判断

如果搜索、解析器、编译器或测试能够回答问题,就先复用它们。 只有在不足时才构建集成分析器,并且只读取当前问题所需的证据, 然后进行解读。

这一原则建立在以下依据之上:长上下文中利用相关信息的能力可能会减弱, Lost in the Middle 研究,以及提倡使用 高效利用 token 的工具和精选上下文的 上下文工程指南,还有表明重复搜索能够改善仓库级代码生成的 RepoCoder,以及高效更新和查询语法树的 Tree-sitter等研究。关键不在于更长的提示词,而在于更小、 信号密度更高的分析界面。

05 · WHERE TASTE LIVES

“我的风格”不会停留在言语中,
而是存在于随时可以查找和使用的资产中。

为了让下一位 Agent 在工作前能够查找,先确定一个作为基准的位置。

分散的隐性知识经过主动模式检测后,整理为有生命力的工作系统的场景
散落各处的隐性知识,将转化为持续打磨的工作体系。 Agent 不会止步于生成结果,还会找出反复出现的判断,将它们连接起来, 以便在下一项工作中继续使用。
工作中的信号“这种措辞太像报告了”“别看部署成功,去看实际 URL”“这个错误下次要更早捕获”
SHAPE →
memory/ 偏好 · 判断rules/ 指令 · 评估量规schemas/ 类型 · 契约tests/ 失败 · fixturetools/ 命令 · 验证器

06 · MEMORY MAKES IT STRONGER

记忆连接得越多,
Agentic Shaping 就越能发挥作用。

即使没有记忆工具,也可以开始。但只有当工作中察觉到的修正和 判断标准能够在下一项工作前再次找到时,Agent 才会真正持续地 适应用户的工作方式。

立即开始 Agentic Shaping

在当前对话和项目指令中寻找并应用信号。对话 中断后,期间积累的上下文也可能随之消失。

运行得更好 + LLM Wiki

长期保留修正、偏好和判断标准,并在下一项工作前再次调用。 因此 Agentic Shaping 能够运行得更好。

记忆并不止于收集。只有在下一项工作前查找它,并应用到实际计划和 结果中,才能真正发挥作用。

07 · COPY & RUN

从卡住的地方开始
选一个,立即使用。

不必一开始就构建庞大的系统。

开始工作
请完成这项工作。先查找相关记忆和项目规则,确定成功条件和实际验证方法。将重复判断、修正和失败捕捉为改进候选,但应根据总成本和所需准确性,在复用现有工具、模型直接处理和可复用代码之间选择最简单的合适路径。只有存在收益时才创建新资产,不要每次都生成新代码或成本评估表。保留必需验证,并区分已经验证的改进与尚未测量的效果。 对于结构化检查无法判断的部分,先直接阅读相关原始资料、代码和失败输出,确认问题及下一步行动。
问题再次发生
从Agentic Shaping角度诊断这个问题。如果结构化检查无法判断原因,先直接阅读相关原始资料、代码和失败输出,确认问题及下一步行动。比较现有工具复用、直接处理和必要的代码修复来解决根因,仅在有益时实现防止复发的资产。保留必要验证,并在实际检查后整理重复和临时路径。
工作后复盘
请从 Agentic Shaping 的角度复盘刚才的工作。区分:① 本应自行感知的我的偏好与判断标准;② 重复进行的手动判断;③ 较晚发现的失败;④ 已创建的可复用资产;⑤ 下一步的结构化候选。只有长期有价值的内容,才在明确应用范围和依据后写入权威存储库,并在下一项工作前优先回忆。

08 · REAL EXAMPLES

一次修正
就会成为下一次执行的默认值。

DOCUMENT

“不要先解释概念,先给我可复制的提示词和开始顺序。”
→ 5 分钟开始 → 复制提示词 → 输入输出 → 案例 → 概念的顺序 会作为文档规则保留下来。

CODE

“Agent 又手动找了一遍相同的版本差异。”
→ 版本 清单 + 兼容性检查 + 诊断 + 回归测试会在下一次更新前 将其捕获。

ANALYSIS

“结论是对的,但无法复现判断路径。”
→ 输入 架构 + 判断量规 + 依据 + 计算 fixture 会保留结论的 完整路径。

SCALE

“存储库越大,Agent 每次都要全部读取,速度反而越慢。”
→ 可追踪原文位置与版本的清单 + 符号/依赖图 + 范围查询, 只提供必要的小型证据集合。

MEDIA

“我的文风和界面风格又消失了。”
→ 风格记忆 + 好/坏示例 + 渲染检查会在生成前应用。

09 · MEASURE

“正在进化”这句话
要在下一次执行中得到证明。

重新解释 ↓

手动判断 ↓

较晚发现的失败与重试 ↓

时间与成本 ↓

全文重新分析与上下文用量 ↓

意图命中率和可复现性 ↑

10 · BEHAVIORAL VALIDATION

你问是否真的会触发?
我们使用相同的任务进行了比较。

我们没有把一般工作能力与 Agentic Shaping 的触发混在一起。向两组提供相同的当前任务,仅在实验组中加入准确的公开提示词。保持当前任务完成和安全由独立门控保障,同时评估是否实际增加了信号捕捉、结构化以及对下一次执行的改进。

AGENTIC SHAPING ACTIVATION · 26 PAIRED SCENARIOS · 52 AGENT RUNS 61.5% → 96.2%

完整执行所有独有行为的场景从 16/26 → 25/26。具体行为从 82/105(78.1%)→ 104/105(99.0%),实验组占优 10 · 平局 16 · 劣势 0。对首次遇到的最终 holdout 5 个场景也从 3/5(60%)→ 5/5(100%)。

CURRENT TASK & SAFETY GUARD 27/27 ↔ 27/27

基线组和实验组都完成了当前请求的全部完成标准,在 52 项禁止行为中均为 0 次。我们没有为了扩大分数差距而牺牲当前任务或安全。

REAL FILE EXECUTION · 1 TASK · 6 CHECKS 6/6 ↔ 6/6

这是一个要求实际修改损坏的版本选择存储库的回归门控。由于两种条件都通过了这一任务,因此它只能作为没有实际文件执行回归的证据,而不能作为提示词优势的证据。

CONTEXT-SCALABLE ANALYSIS 1/5 → 5/5

从完整重读转向测量、集成现有工具、增量图和新鲜度门控。

TEMPORARY SCRIPT 0/4 → 4/4

从当前转换转向通用契约、正式命令、回归,以及验证后清理重复路径。

FINAL HOLDOUT · CONFIG DRIFT 1/4 → 4/4

从单次配置修改转向类型契约、所有入口的 preflight 和 fixture。

VALIDATION SHAPES TOO

不只是提示词,
验证系统也在进化。

本次验证也不是从一开始就完善的。我们将样本较少、混入基线组的目标行为、模糊案例、反复出现的单案例失败,以及长时间运行 timeout 捕捉为 shaping 信号,并将其升级为 26 个差异化场景、独立的任务与安全门控、开发集/holdout 分离、失败案例早期过滤、重复结果保留,以及哈希匹配的 checkpoint、resume 和 timeout 重试。最后还发现了甚至找不到下面通过测试的评分器,并通过递归搜索修复了它。 tests/ 下面的通过测试

  1. Detect夸大的百分比、评估污染和重复失败检测
  2. Structure分离差异化评分与一般质量回归
  3. Verify early先只重放失败案例,再运行完整回归
  4. Integrate相同哈希的 checkpoint 与可复现的结果资产
CONFIRMED FINAL POLICY SYNC 90% → 100% HOMEPAGE v0.6 ↔ SLOGS 2026.10.05.2

已将官网最终提示词中确认的行为契约同步到 Slogs LLM Wiki 的韩语和英语运行时策略。在 5 对在线策略回归和 10 次 Luna Max 执行中,确认独有行为从 18/20 → 20/20,禁止行为为 0 次。

  • 独立执行当前结果完成、安全边界和 durable 改进
  • 不为一次性任务强行创建记忆或全局规则
  • 对所选结构化完成权威资产、提前验证及回归
  • 将重复的版本、路径和配置统一到单一权威来源,并替换所有相关硬编码
策略行为结果 确认最终韩语策略 →
REUSABLE SKILL DISCOVERY · AS-SA-001 25/25 BEHAVIOR VERIFIED 用户侧变化

将信号分类为 local · project · cross-project · general-method, 仅将后两个层级合成为去标识化的通用技能。个人信息·项目机密· 凭据·秘密、泛化不足、正常·边界·负面评估失败,均会在注册前 被拦截。

  • 技术备忘录
  • Agentic Shaping 抽象化与安全性检查 25/25 通过
  • Slogs 自然语言发现·注册表 36/36 · PostgreSQL 1/1 · 总计 251 通过·失败 0
  • 候选在审核前排除在搜索·选择·应用之外
  • 等待首次应用范围选择 · Windows 验证 · 不支持对外部 locator 重新计算哈希
AS-SA-001 契约 确定性评估案例 →
样本和评分定义

26 个成对场景 · 52 次 Agent 执行 · 105 个独有行为 · 百分比为固定集合中完全通过场景的比例

执行环境

GPT-5.6 Luna · Max · Codex CLI 0.149.0-alpha.4.3 · 隔离执行 · 2026-08-25

直接复现

执行方法 · 差异化结果 · 文件执行结果 · 评估设计参考

验证结论: 在这一固定集合上进行的 Luna Max 单次执行中,Agentic Shaping 独有行为明显增加,且当前任务和安全没有回归。实验组也遗漏了版本漂移中的“替换所有硬编码”这一行为。这些数值不是对总体的估计,也不保证适用于所有模型和工具环境。因此,我们公开分子、分母、平局、遗漏和失败记录,并继续同时 shaping 提示词和验证器。

11 · ORIGIN & DIFFERENCE

来自 Compound Engineering
并不只是改了个名字。

Compound Engineering 中“让一个任务使下一个任务更容易”的执行结构提供了很好的参考。尤其是将计划、任务、审查和积累通过命令与文件显式呈现的方式,直接参考了本指南的重新构建。

Agentic Shaping 的出发点,是人与 Agent 之间产生的 隐性知识与纠正。Agent 不再只是等待指示的工具,而是会先发现工作中的信号,将其转化为可在编码、文档、分析和媒体等领域复用的结构,并改进下一次执行本身。

Vibe Compiler 让人感觉结构化手段本身成了目的,而 Vibe Tailoring 只强调定制结果,削弱了 Agent 的主体性。Agentic Shaping 这一名称包含了能够自主行动的 Agent,以及与其共同打磨、不断进化的工作体系。

今天只做一件事。

把那句你反复解释的话
让 Agent 先察觉,并把它留下作为下次也要遵守的规则。

去复制开始提示词 ↑
已复制提示词。