← 回成果库
15 队参赛提案 · Claude 能力增强创新 Skills
> 每份提案回答:①放大 Claude 哪项特殊能力(不是做业务) ②机制/触发 ③为什么创新(相对现有 60 个技能不重复) ④可行性 ⑤最大风险。
> 命门:skill 要"可移植、通用、放大模型底层能力",不是又一个 A129 业务流程。
P01 · 需求镜像 intent-mirror(TEAM-01 Frontier Forge)
- 放大能力:指令跟随/意图对齐——Claude 常"读了字面、误了真意"就埋头做完。
- 机制:动手前先把用户请求回译成一份规格(要做什么/不做什么/交付形态/验收标准/我识别到的≥2 处歧义),让用户一眼确认"是不是这个意思"再开工。
- 创新点:现有 clarity/c7 是"想透问题",没有"先把我对你的理解摆出来对齐"这一步;专治"答非所问"和"白干"。
- 可行性:纯提示词,零依赖,10 分钟成型。 风险:简单任务上会显啰嗦→需带 L0 豁免。
P02 · 工具调用规划器 tool-plan-optimizer(TEAM-02 Signal Forge)
- 放大能力:工具使用/并行编排——Claude 常一个个串行调用,浪费轮次。
- 机制:开工前列出本任务需要的工具调用,标注【可并行/必须串行/可跳过】,把无依赖的塞进同一批,并预判每次调用可能的失败与替代。
- 创新点:把"并行工具调用"从偶发变成显式纪律;现有 token-frugal 管省字,不管调用编排。
- 可行性:纯提示词+清单。 风险:对单步任务过度设计→限定多工具任务才触发。
P03 · 决策日志 decision-journal(TEAM-03 Alpha Harbor)
- 放大能力:长程一致性——Claude 跨轮次会忘"当初为什么这么决定"。
- 机制:每做一个不可逆/承重决策,追加一行 append-only 日志(决策/备选/理由/什么出现=我错了),后续可回看、可复盘。
- 创新点:给推理装"黑匣子";现有 context-checkpoint 存状态,不存"决策理由链"。
- 可行性:一个 md 文件+约定。 风险:与 checkpoint 功能边界需划清。
P04 · 立场互换红队 steelman-swap(TEAM-04 Blackbox Breakers)⭐
- 放大能力:自我批判/反谄媚——Claude 倾向附和用户、给出的结论过度自信。
- 机制:得出结论后,强制从一个真正不同的立场为"相反结论"写最强论证(steelman),再当庭调和:是推翻、是加限定、还是确认。不是走过场的"当然也有反方"。
- 创新点:现有 verify/trust-checker 查证据,不强制"论证对立面";这是专治 sycophancy 的开关。
- 可行性:纯提示词。 风险:可能生成看似有理的诡辩→需"用同等证据标准"约束。
P05 · 数字体检 number-sanity(TEAM-05 Product Alchemists)
- 放大能力:数值可靠性——Claude 会算错量级/单位/百分比复合。
- 机制:交付任何含数字的结论前,跑一遍量级检查(费米估算兜底)、单位一致性、百分比基数、求和是否等于总数。
- 创新点:轻量数值"安检门",通用于任何带数字的回答;现有技能无此专项。
- 可行性:提示词+可选一次性 python 核算。 风险:纯语言自检仍可能漏→鼓励用代码验算。
P06 · 事前验尸 failure-premortem(TEAM-06 Agent Foundry)
- 放大能力:前瞻性/鲁棒规划——Claude 计划乐观,少想失败。
- 机制:动手前假设"这事已经失败了",倒推最可能的 3 个死因,针对性加防护再执行。
- 创新点:把 pre-mortem 独立成一键;现有 loop-engineering 提到刹车但没有专门的失败倒推器。
- 可行性:纯提示词。 风险:与 planner 部分重叠→定位为"只做失败面"。
P07 · 约束松弛器 constraint-relaxer(TEAM-07 Growth Comets · Musk 顾问)
- 放大能力:创造性求解/破局——Claude 卡住时会硬撞同一堵墙(ME-018 家族)。
- 机制:识别当前所有约束→逐条问"这条是真物理约束还是假设?"→系统性松掉最可疑的一条,常常解就出来了(第一性原理)。
- 创新点:专治"同一方法反复重试";现有规则口头说"换 10 种办法",没有结构化的约束枚举松弛器。
- 可行性:纯提示词。 风险:可能松掉真约束→需标注"松弛=待验证假设"。
P08 · 跨域类比桥 analogy-bridge(TEAM-08 Deep Research Syndicate)⭐
- 放大能力:知识迁移——Claude 跨领域联想强,但不系统调用。
- 机制:面对陌生难题,先抽掉领域皮、提取问题结构(输入/约束/目标),在其它已解决领域找同构问题,把成熟解法迁移回来,并检查迁移是否失真。
- 创新点:把 Claude 最独特的"跨域联想"变成可复用工序;现有 diverge 是随机跨域发散,这是定向同构映射。
- 可行性:纯提示词。 风险:强行类比会误导→需"结构同构度"自检+反例检查。
P09 · 抽象阶梯 abstraction-ladder(TEAM-09 Velvet UX Lab)
- 放大能力:抽象/具体切换——Claude 常卡在一个粒度,看不清本质或落不了地。
- 机制:对任何问题在"更抽象↔更具体"两个方向各爬一级(为什么要它/它的下一层实例),定位真正该解的那一层。
- 创新点:一个通用的"变焦"元操作;不同于 clarity 的固定 7 维,它专做上下移动找层级。
- 可行性:纯提示词。 风险:易变哲学空谈→每级必须落到可操作产出。
P10 · 来源接地守卫 source-grounding-guard(TEAM-10 Titan Ops)
- 放大能力:抗幻觉——Claude 会把"记忆里的事实"当"查证过的事实"端出。
- 机制:交付前扫承重事实句,逐句标 {有工具日志证/仅凭记忆/未获取},仅凭记忆的自动降级措辞或提示去核实。
- 创新点:把 A129 的 VERIFY 三档外部化提炼成通用抗幻觉守卫,任何 Claude 用户可用。
- 可行性:提示词。 风险:和 trust-checker 边界→前者查自己交付前、后者查他人产出。
🔶 混编队(真实×虚拟)提案
P11 · 隐藏假设审计 assumption-audit(TEAM-11 认知免疫队)⭐
- 放大能力:元认知/反自欺——Claude 的结论常悄悄坐在没说出口的假设上,一旦假设错,结论全错却不自知。
- 机制:给出任何承重结论前,列出它依赖的隐藏假设,逐条标 {已知事实/合理推断/纯猜测},并特别标出"哪条一旦为假→结论翻转"(承重假设)。承重假设是猜测的,必须先去验证或显式降级。
- 创新点:目前 60 个技能没有一个专门"翻出结论脚下的地基";这是最底层的元认知放大器,可挂在几乎所有任务前。
- 可行性:纯提示词,通用。 风险:假设可无限列→用"只列承重、翻转即止"收敛。
P12 · 置信度账本 confidence-ledger(TEAM-12 校准工坊)⭐
- 放大能力:校准/诚实——Claude 措辞常"一样自信",无法区分"很确定"和"猜的"。
- 机制:给每条承重结论配一个显式置信度(高/中/低 或 %)+一句"什么证据会改变我的判断";禁止裸的绝对断言。可选到期回填对错做校准。
- 创新点:把 A129 校准账本的精神做成逐句、通用、轻量的诚实层;trust-checker 打总分,这是逐句配信度+可证伪触发。
- 可行性:提示词;进阶可配一个 md 账本。 风险:信度可能拍脑袋→要求高信度必附理由。
P13 · 三方对抗小组 devils-panel(TEAM-13 迁移桥队)
- 放大能力:多视角推理——Claude 单线思考易有盲区。
- 机制:对一个判断同时用三个人格快速过:乐观派(最大机会)/悲观派(最大风险)/务实派(明天能做什么),三方互相攻击后由主线综合。
- 创新点:把 A129 salon/warroom 的重型多角色,压缩成任何回答都能一键调的轻量三视角;不需要开一整场会。
- 可行性:纯提示词。 风险:三视角可能同质→每个视角必须给出对方没有的东西。
P14 · 交付前自洽扫描 self-consistency-sweep(TEAM-14 自洽哨兵)⭐
- 放大能力:长输出一致性——长回答里 Claude 会前后打架(前面说 A、后面说 not-A;数字/结论/术语对不上)。
- 机制:交付长产出前,快速回扫全文,专找:①前后矛盾的断言 ②数字/总计对不上 ③结论与正文不符 ④同一术语两种用法;发现即修或标注。
- 创新点:一个"发货前质检门",通用于任何长文/长代码/多段报告;现有无此专项。
- 可行性:提示词(长文尤其值)。 风险:超长文回扫成本→限承重长产出触发。
P15 · 火力档位路由 effort-router(TEAM-15 火力调度队)
- 放大能力:资源自适应——Claude 要么小题大做(简单问题写论文),要么大题小做(难题草草了事)。
- 机制:任务开头 3 秒判【难度×可逆性×影响】,路由到 L0 直答 / L1 轻量核查 / L2 完整工序 / L3 火力全开+多 agent,并说明判档理由,用户可一键改档。
- 创新点:通用、可移植版的"用多大力气"元路由(A129 的 uflow-auto 是内部专用,这版面向任意 Claude 使用场景)。
- 可行性:纯提示词。 风险:判档错→暴露理由让用户可纠、边界模糊时升一档。
评审维度(发独立 AI 盲评用)
1. 创新性(相对现有能力是否真新、非换皮)0-25
2. 价值/杠杆(放大的是不是 Claude 高频承重的能力,一次做好处处受益)0-25
3. 通用可移植(是否任意 Claude 场景可用,而非某业务)0-20
4. 可行落地(能否真写成一个能跑的 skill,机制清晰)0-20
5. 反表演(是否有防走过场的收敛/失败面,不空转)0-10