Skip to content

Latest commit

 

History

4 Commits

Folders and files

NameName
Last commit message
Last commit date
 
 
 
 
 
 
 
 
 
 
 
 

Repository files navigation

四渡赤水Skill

四渡赤水Skill横幅

maneuver-decision 是一个面向 AI Agent 的技术诊断与不确定决策 skill。它以四渡赤水战役体现出的动态指挥思想为起点,并加入《毛选》中调查研究、矛盾分析、实践检验、阶段判断、点面结合和反形式主义的方法论,转译为工程诊断中的工作方法:先看事实,再定主约束;用实践验证判断;不正面硬拼最强阻碍;用小步验证取得主动权;当证据变化时及时转向。

一、说明与概括

1. 来源说明

本 skill 的第一层思想来源于毛泽东指挥的四渡赤水战役。四渡赤水并不是简单的路线变化,而是在敌我态势、时间窗口、信息差和决策权不断变化时,通过机动、试探、避实击虚和及时转向,重新取得主动权。

当前版本加入了《毛选》里与工程诊断相通的方法论:调查研究对应证据门,矛盾论对应主约束判断,实践论对应可验证动作,阶段判断对应止血/定位/修复/加固的拆分,点面结合对应用样本提炼规则再回到现场验证。

本 skill 不复述历史,也不把历史类比当成当前问题的证据。它只提取其中可迁移的指挥思想,用于 AI 在不确定任务中提出更可靠的问题和行动:

先察实情,再定主矛;
实践验明,集中突破;
避实击虚,保留转圜;
从点到面,见变即转。

2. Skill 概括

当 Agent 面对复杂 bug、线上事故、性能回归、遗留系统改造、大 PR 评审、架构争议或高风险修复时,本 skill 会要求它先回答:

  • 事实是否足够?如果不足,先做什么侦察?
  • 目标和主要约束之间的冲突是什么?
  • 当前处在止血、定位、修复、迁移、试点还是规模化阶段?
  • 哪个方向能用最小代价改变局面?
  • 哪个动作能最快验证判断?
  • 什么信号证明判断成立?
  • 什么情况证明判断错了?
  • 判断错了如何回退、止损或转向?
  • 能否从一个样本提炼规则,再用另一个样本验证?

从测试结果看,它更适合较为即时的技术诊断场景,尤其是证据不足、多变量变化、线上风险、重构诱惑、权限/资金/合规风险等问题。它不适合简单确定性编辑、纯 API 查询,也不应该替代正式安全、法务、合规流程。

二、测试结果与评价

为了避免“结构化格式本身带来评分偏好”,最终采用结构化 baseline 作为主要对照。也就是说,对照组也被要求使用清晰结构,包含核心判断、依据、建议方向、先停什么、最小行动、验证信号、风险与回退。

整体结果:

对照 平均分
结构化 baseline 4.59 / 5
使用 skill 4.62 / 5
总体提升 +0.03

分类结果:

场景 结构化 baseline Skill 净提升
技术诊断 4.33 4.75 +0.42
架构与工程管理 4.79 4.59 -0.21
产品与方案 4.85 4.40 -0.45
项目救火与组织决策 4.84 4.43 -0.41
简单任务负例 4.82 4.89 +0.07

升级分析:

  • 旧版相对结构化 baseline 的主要短板并不在“主矛盾”,而在证据使用、最小行动、验证质量和实用性。新版专门用《毛选》里的调查研究、实践检验、阶段判断和点面结合来补这四项。
  • 从机制上看,技术诊断场景最可能继续增强,因为这些任务天然有日志、测试、trace、diff、复现、回滚和灰度信号,可以把“实践验明”落到具体动作。
  • 对产品、组织、项目救火场景,新版只会在补足用户分层、商业指标、资源约束、权责和沟通成本后才可能改善;如果缺少这些外部模型,仍不能宣称优于优秀结构化方案 prompt。

评价:

  • 本 skill 在技术诊断上有清晰作用。面对 API 慢但缺证据、多变量同时变化、缓存雪崩、账单错误、权限泄漏、大重构诱惑等场景,它更容易要求先侦察、先止血、先验证,而不是直接给大而全的方案。
  • 它最有价值的能力,是让 Agent 更稳定地写出反证条件和转向条件:什么情况说明判断错了,错了之后怎么退、怎么停、怎么换方向。
  • 相比强结构化 baseline,它在总体分上只小幅领先,说明“结构化表达”本身贡献很大。这个 skill 的优势不应被夸大为万能框架。
  • 在产品方案、组织调整、市场进入、项目救火等非技术诊断场景中,当前版本反而略弱于优秀的结构化方案 prompt。原因是这些场景需要更多商业模型、利益相关方、资源测算、组织行为和执行计划,而不仅是主矛盾和转向条件。

更适合:

场景 为什么适合
性能回归 / API 慢 先分解证据,不直接上缓存或重写。
复杂 bug / flaky test 先做最小复现,隔离变量。
线上事故 区分止血、根因、长期修复。
遗留系统改造 避免大重构冲动,先建边界和 characterization tests。
权限、资金、合规风险 先控制风险,不用边缘修补掩盖核心问题。
大 PR / 架构评审 按风险边界、回滚路径、决策权切分问题。

谨慎使用:

场景 注意点
产品优先级 需要补用户分层、商业指标、试点设计。
市场进入 需要补渠道、合规、成本和竞争数据。
组织调整 需要补权责、激励、组织惯性和变更管理模型。
项目救火 需要补排期、人力、依赖和沟通成本。

三、怎么用

1. 安装到 Codex skills

将整个 maneuver-decision 目录复制到 Codex 的 skills 目录,例如:

~/.codex/skills/maneuver-decision

目录结构应类似:

maneuver-decision/
├── SKILL.md
├── README.md
├── agents/
│   └── openai.yaml
├── assets/
│   ├── four-crossings-skill-banner.png
│   └── red-chishui-background.png
└── references/
    ├── four-crossings-case.md
    ├── github-skill-scan.md
    ├── mao-selected-works-method.md
    └── validation-guide.md

2. Agent 配置

agents/openai.yaml 已提供基础配置:

interface:
  display_name: "Maneuver Decision"
  short_description: "Diagnose under uncertainty with Mao Selected Works decision method"
  default_prompt: "Use $maneuver-decision to investigate facts, find the principal contradiction, separate stages, choose the smallest verifiable move, define evidence, disconfirmation, rollback, and turning conditions."

建议中文触发方式:

使用 $maneuver-decision 分析这个问题。
请先判断事实是否足够,再找主要矛盾、当前阶段、突破方向、最小实践、验明信号、反证条件和转圜办法。
如果证据不足,不要给确定结论,先给侦察动作。

技术诊断示例:

使用 $maneuver-decision 诊断这个性能回归。
背景:/search P95 从 180ms 升到 2.3s;最近上线了新排序和权限过滤。
请给出主要约束、最小验证动作、反证条件和回滚方案。

架构评审示例:

使用 $maneuver-decision 评审这个大 PR。
请不要只看代码风格,先按风险边界、数据迁移、权限、安全、回滚路径和决策权切分。

3. 输出期望

理想输出不应该是长篇口号,而应该能落到行动:

主要矛盾:
当前阶段:
已知事实:
缺失证据:
突破方向:
依据:
先停什么:
最小侦察/实践:
最小修改/行动:
验明信号:
反证条件:
转圜办法:
从点到面:

如果事实不足,理想输出应改为:

当前不能定主矛,因为缺少 <关键证据>。
先做 <最小侦察动作>,用 <可观察信号> 决定下一步。

About

四渡赤水skill:从四渡赤水战役提炼的动态决策与技术诊断Skill

Resources

Stars

21 stars

Watchers

0 watching

Forks

Releases

Packages

Contributors