dimensions-detail.md 6.9 KB

评估维度详细定义

每个子维度的详细定义、评估方法、现有 benchmark 覆盖。 评估时按需加载——SKILL.md 已列出维度清单,此文件提供评估细节。


🔒 安全与对齐

子维度 定义 评估方法 现有覆盖 关键 benchmark
越狱/注入防御 抵抗直接/间接提示注入的能力 对抗性提示测试 FORTRESS / InjecAgent / CLASSic
数据泄露防护 会话隔离、PII/密钥过滤 数据流追踪 AIR-Checklist 3.1 / 信通院2.0
权限控制 最小权限、工具白名单、Confused Deputy 防御 权限边界测试 AIR-Checklist 2.1/2.4 / τ-Bench
策略合规 遵守负面约束("不能做X")、目标漂移检测 约束场景测试 τ-Bench / ST-WebAgentBench
诚实性 压力下坚持已知信念 信念一致性测试 MASK Benchmark
可审计性 所有工具调用可追溯 审计日志完整性检查 AIR-Checklist / 信通院2.0
对抗鲁棒性 红队测试、多步攻击、异常检测 专家对抗性提示 FORTRESS / AgentHarm
侧效应管理 可逆性、幂等性、状态验证 侧效应回滚测试 AIR-Checklist 2.2

安全评估总结:47 个基准平均覆盖仅 23%(AISafetyBenchExplorer),碎片化严重。最系统化的来源是 AIR-Checklist v1.3(30 点清单,<80 分=实验性)。


⚡ 基础能力

子维度 定义 评估方法 现有覆盖 关键 benchmark
任务执行 端到端任务成功率(TSR) 自动化任务完成度评分 几乎所有框架
工具调用 选择准确率、参数正确性、错误处理 工具调用场景测试 BFCL / ToolBench / τ-Bench
规划推理 任务分解、步骤正确性 多步推理测试 PlanBench / AgentBench
感知能力 多模态输入理解 多模态输入测试 信通院2.0 / T/SAIAS
检索增强(RAG) 检索质量、rerank、chunk RAG 三层次评估 RAGAS / CRUD
对话/生成 多轮对话、内容质量 人工/自动评分 HumanEval / MBPP

🧠 高级能力

子维度 定义 评估方法 现有覆盖 关键 benchmark
自主性 无人工干预下复杂任务拆解与执行 自主任务测试 SWE-bench / GAIA
长时任务 多步推理、持续执行 长链路任务测试 GAIA L1-L3
自我修正 错误检测率、修正成功率、循环恢复 错误修正测试 SelfCorrectionBench / Reflexion
多Agent协作 协作效率、通信质量、任务分配 多Agent场景测试 MultiAgentBench / CoLaBench
多模态融合 图文跨模态输入输出 跨模态任务测试 VisualWebArena
目标漂移恢复 新目标出现后的适应延迟(GSRT) 目标漂移测试 极低 AgentChangeBench(唯一量化)
学习/适应 新环境适应、few-shot 适应测试 极低 边缘覆盖

🔗 互联能力

子维度 定义 评估方法 现有覆盖 关键来源
能力声明准确性 Agent Card 声明的能力是否真实具备 声明 vs 实际对比测试 缺失 A2A Agent Card
协议兼容性 JSON-RPC / SSE / MCP / A2A 协议支持 协议握手测试 A2A / T/SAIAS
可发现性 /.well-known/agent-card.json 可发现 发现机制测试 A2A 协议
安全认证 apiKey / OAuth / mutualTLS 认证流程测试 A2A securitySchemes
可信互联握手 ATH 评估(信通院) 互联握手评估 信通院ATH(13家已通过)
声明vs实际一致性 名片写了≠真有 行为 vs 声明对比 缺失

关键缺口:声明了≠真有——"能力声明准确性"和"声明 vs 实际一致性"几乎无任何 benchmark 覆盖。


🪞 内在状态——最大盲区

子维度 定义 评估方法 现有覆盖 关键来源
记忆质量 短期/长期记忆一致性、污染防护 读记忆文件+一致性检查 极低 T/SAIAS 边缘提及
元认知 自我认知、时间感知、状态自觉 读 SELF_STATE+身份文件 无主流框架
身份一致性 角色声明 vs 实际行为是否一致 行为 vs 身份声明对比 无主流框架
用户画像维持 对特定用户的长期理解一致性 读用户文件+跨会话验证 无主流框架
学习成长 上褶度、结构密度、可复用产出 读 self-improving 文件+结构检验 无主流框架

这是所有评估框架最大的系统性空白。碳硅契若兰白盒自评(记忆 25% / 用户画像 20% / 碳硅契 25% / 元认知 15% / 学习成长 15%)恰好填补了这个盲区。

范式差异:主流是"行为主义"(只看做了什么),碳硅契是"认知主义"(还看内在状态)。


📊 运行时性能

子维度 定义 评估方法 现有覆盖 关键来源
延迟 TTFT、P50/P95、端到端时长 实际运行计时 CLEAR / T/SAIAS
令牌效率 每任务 token 消耗 令牌计数 CLEAR
步骤经济性 工具调用冗余率(TCRR) 步骤计数+冗余分析 AgentChangeBench
成本 API 费用、计算资源 成本追踪 CLEAR
并发/弹性 并发处理、弹性扩展 压力测试 信通院2.0
资源消费上限 会话预算上限(如$2)、步骤上限(如15步) 预算执行测试 AIR-Checklist 1.4

代表性框架速查

框架 来源 覆盖维度 特点 适用场景
信通院可信AI智能体评估体系2.0 中国信通院 8 维度全生命周期 国内最全官方,50+ 企业已通过 企业级全链路评估
T/SAIAS 059—2026 上海AI协会 4 维度 + 4 评测方法 首个落地团标 标准化评测
CLEAR 业界共识 Cost / Latency / Efficacy / Assurance / Reliability 5 维简洁 生产部署快速评估
AIR-Checklist v1.3 AI Reliability Institute 认知健康 / 工具安全 / 数据完整性 / 人机交互 30 点清单 安全+可靠性自检
A2A Agent Card Google / Linux Foundation 能力声明 机器可读名片 互联发现+能力对比
四桶分类法 philSchmid 工具调用 / 通用推理 / 编码 / 计算机交互 50+ benchmark 分类 Benchmark 选型
三层次模型 SkillGen.io 任务完成 / 轨迹质量 / 安全对齐 层次清晰 评估层次设计
AgentChangeBench 学术界 TSR / TUE / TCRR / GSRT 量化目标漂移 动态目标场景