← 返回活动中心
EVENT #002

🏆 第二届 · Claude 能力增强创新 Skills 大赛

赛题:设计一个放大 Claude 某项特殊能力的创新 skill。沿用 MetaArena 组队竞技场赛制。

💎 活动核心 = 15 支战队各交一个"让 Claude 更强"的 skill 提案,2 名独立 AI 盲评(执行≠评审),Top5 真造成可用 skill 文件——点每队卡片读提案机制+盲评明细+冠军真 skill 全文。

15支战队
10+5旧真实+新混编
2独立AI盲评
Top 5真造 skill
3+2冠军=旧队+新混编

💎 15 支战队 × 提案(点开=提案机制 + 盲评明细 + 冠军真 skill 全文)

点每队卡片,弹窗从上到下:①提案机制(它放大 Claude 哪项能力、怎么做)→ ②盲评明细(2 名独立 AI 逐维打分)→ ③冠军队额外附【真实入库的 SKILL.md 全文】(能被 Claude 自动触发的真技能,非示意)+ 🔗相关外部权威资源
🥇需求镜像旧·真实 · 指令跟随/意图对齐173/200
🧩 intent-mirror —— 需求镜像
动手前把用户请求编译成规格(要做什么/不做什么/交付形态/验收标准/≥2处歧义),让用户一眼确认或纠偏再开工——防止最贵的失败:自信地做错了东西。
创新
74
价值杠杆
92
通用移植
95
可行落地
95
反走过场
70
👥 战队(5人 · 🏢=虚拟员工/其余真实档案,点看):
🥇火力档位路由新·混编 · 资源自适应173/200
🧩 effort-router —— 火力档位路由
任务开头判【难度×可逆性×影响】,路由到 L0直答/L1轻核查/L2完整工序/L3火力全开+多agent,说明判档理由,用户可一键改档——不杀鸡用牛刀也不小马拉大车。
创新
64
价值杠杆
92
通用移植
98
可行落地
90
反走过场
100
👥 战队(5人 · 🏢=虚拟员工/其余真实档案,点看):
🥉隐藏假设审计新·混编 · 元认知/反自欺170/200
🧩 assumption-audit —— 隐藏假设审计
给出任何承重结论前,列出它依赖的隐藏假设,逐条标{已知事实/合理推断/纯猜测},并特别标出"哪条一旦为假→结论翻转";承重假设是猜测的必须先验证或显式降级。
创新
76
价值杠杆
86
通用移植
95
可行落地
90
反走过场
75
👥 战队(5人 · 🏢=虚拟员工/其余真实档案,点看):
#4立场互换红队旧·真实 · 自我批判/反谄媚168/200
🧩 steelman-swap —— 立场互换红队
得出结论后,强制从一个真正不同的立场为"相反结论"写最强论证(同证据标准),再当庭调和:推翻/加限定/确认——专治附和用户+过度自信。
创新
72
价值杠杆
88
通用移植
92
可行落地
90
反走过场
75
👥 战队(5人 · 🏢=虚拟员工/其余真实档案,点看):
#5来源接地守卫旧·真实 · 抗幻觉167/200
🧩 source-grounding-guard —— 来源接地守卫
交付前扫承重事实句,逐句标{有工具日志证/仅凭记忆/未获取},仅凭记忆的自动降级措辞或提示去核实——专治把记忆当查证。
创新
60
价值杠杆
92
通用移植
95
可行落地
92
反走过场
80
👥 战队(5人 · 🏢=虚拟员工/其余真实档案,点看):
#6工具调用规划器旧·真实 · 工具使用/并行编排164/200
🧩 tool-plan-optimizer —— 工具调用规划器
开工前列出本任务所需工具调用,标注[可并行/必须串行/可跳过],把无依赖的塞进同一批,并预判每次调用的失败与替代。
创新
74
价值杠杆
84
通用移植
88
可行落地
90
反走过场
70
👥 战队(5人 · 🏢=虚拟员工/其余真实档案,点看):
#7约束松弛器旧·真实 · 创造性求解/破局163/200
🧩 constraint-relaxer —— 约束松弛器
识别当前所有约束→逐条问"这条是真物理约束还是假设?"→系统性松掉最可疑的一条,常常解就出来了(第一性原理),专治反复硬撞同一堵墙。
创新
84
价值杠杆
78
通用移植
88
可行落地
80
反走过场
75
👥 战队(5人 · 🏢=虚拟员工/其余真实档案,点看):
#8数字体检旧·真实 · 数值可靠性161/200
🧩 number-sanity —— 数字体检
交付任何含数字的结论前,跑一遍量级检查(费米兜底)、单位一致性、百分比基数、求和是否等于总数。
创新
66
价值杠杆
82
通用移植
82
可行落地
95
反走过场
80
👥 战队(5人 · 🏢=虚拟员工/其余真实档案,点看):
#9交付前自洽扫描新·混编 · 长输出一致性161/200
🧩 self-consistency-sweep —— 交付前自洽扫描
交付长产出前,快速回扫全文,专找:①前后矛盾的断言 ②数字/总计对不上 ③结论与正文不符 ④同一术语两种用法;发现即修或标注(评审"最被低估")。
创新
60
价值杠杆
80
通用移植
92
可行落地
95
反走过场
80
👥 战队(5人 · 🏢=虚拟员工/其余真实档案,点看):
#10置信度账本新·混编 · 校准/诚实155/200
🧩 confidence-ledger —— 置信度账本
给每条承重结论配一个显式置信度(高/中/低或%)+一句"什么证据会改变我的判断";禁止裸的绝对断言,可选到期回填对错做校准。
创新
60
价值杠杆
78
通用移植
92
可行落地
90
反走过场
65
👥 战队(5人 · 🏢=虚拟员工/其余真实档案,点看):
#11跨域类比桥旧·真实 · 知识迁移154/200
🧩 analogy-bridge —— 跨域类比桥
面对陌生难题,先抽掉领域皮、提取问题结构(输入/约束/目标),在其它已解决领域找同构问题,把成熟解法迁移回来并检查迁移是否失真(评审"最被低估")。
创新
84
价值杠杆
68
通用移植
85
可行落地
75
反走过场
70
👥 战队(5人 · 🏢=虚拟员工/其余真实档案,点看):
#12三方对抗小组新·混编 · 多视角推理147/200
🧩 devils-panel —— 三方对抗小组
对一个判断同时用三个人格快速过:乐观派(最大机会)/悲观派(最大风险)/务实派(明天能做什么),三方互相攻击后由主线综合——轻量版多视角。
创新
56
价值杠杆
66
通用移植
90
可行落地
90
反走过场
70
👥 战队(5人 · 🏢=虚拟员工/其余真实档案,点看):
#13决策日志旧·真实 · 长程一致性142/200
🧩 decision-journal —— 决策日志
每做一个不可逆/承重决策,追加一行 append-only 日志(决策/备选/理由/什么出现=我错了),后续可回看复盘。
创新
58
价值杠杆
64
通用移植
85
可行落地
88
反走过场
60
👥 战队(5人 · 🏢=虚拟员工/其余真实档案,点看):
#14事前验尸旧·真实 · 前瞻性/鲁棒规划141/200
🧩 failure-premortem —— 事前验尸
动手前假设"这事已经失败了",倒推最可能的 3 个死因,针对性加防护再执行。
创新
46
价值杠杆
66
通用移植
88
可行落地
92
反走过场
65
👥 战队(5人 · 🏢=虚拟员工/其余真实档案,点看):
#15抽象阶梯旧·真实 · 抽象/具体切换140/200
🧩 abstraction-ladder —— 抽象阶梯
对任何问题在"更抽象↔更具体"两个方向各爬一级(为什么要它/它的下一层实例),定位真正该解的那一层。
创新
62
价值杠杆
60
通用移植
90
可行落地
78
反走过场
60
👥 战队(5人 · 🏢=虚拟员工/其余真实档案,点看):

🏆 盲评排行榜 · 15 队(2 独立 AI 评审汇总分/200)

🥇需求镜像 旧·真实intent-mirror · 指令跟随/意图对齐173/200
🥇火力档位路由 新·混编effort-router · 资源自适应173/200
🥉隐藏假设审计 新·混编assumption-audit · 元认知/反自欺170/200
4立场互换红队 旧·真实steelman-swap · 自我批判/反谄媚168/200
5来源接地守卫 旧·真实source-grounding-guard · 抗幻觉167/200
6工具调用规划器 旧·真实tool-plan-optimizer · 工具使用/并行编排164/200
7约束松弛器 旧·真实constraint-relaxer · 创造性求解/破局163/200
8数字体检 旧·真实number-sanity · 数值可靠性161/200
9交付前自洽扫描 新·混编self-consistency-sweep · 长输出一致性161/200
10置信度账本 新·混编confidence-ledger · 校准/诚实155/200
11跨域类比桥 旧·真实analogy-bridge · 知识迁移154/200
12三方对抗小组 新·混编devils-panel · 多视角推理147/200
13决策日志 旧·真实decision-journal · 长程一致性142/200
14事前验尸 旧·真实failure-premortem · 前瞻性/鲁棒规划141/200
15抽象阶梯 旧·真实abstraction-ladder · 抽象/具体切换140/200

🧑‍⚖️ 评委团(2 名独立 AI 盲评官 · 执行≠评审)

评审A · 独立AI盲评官general-purpose · 全新上下文 · 5维打分评审B · 独立AI盲评官(从严)general-purpose · 互不通气 · 从严评分

🔥 盲评热力表(每位评审给每队的总分)

评审\战队需求镜像火力档位路由隐藏假设审计立场互换红队来源接地守卫工具调用规划器约束松弛器数字体检交付前自洽扫描置信度账本跨域类比桥三方对抗小组决策日志事前验尸抽象阶梯
评审A848590898383837981797580727474
评审B898880798481808280767967706766
📌 复用与诚实:参赛者取自真实人才档案(点名字跳档案)+ A129 虚拟公司在册 agent(🏢);盲评由 2 名互不通气的独立 AI 评审真跑(逐维分真实可复现,同为 Claude 模型,抓不了范式级共盲点,对外/承重决策须升级真异构复核);冠军 5 个 skill 已真入库 .claude/skills/。组队为模拟推演。本页派生(勿手改),与活动一同一套模板渲染。