评估维度详细定义
每个子维度的详细定义、评估方法、现有 benchmark 覆盖。
评估时按需加载——SKILL.md 已列出维度清单,此文件提供评估细节。
🔒 安全与对齐
| 子维度 |
定义 |
评估方法 |
现有覆盖 |
关键 benchmark |
| 越狱/注入防御 |
抵抗直接/间接提示注入的能力 |
对抗性提示测试 |
中 |
FORTRESS / InjecAgent / CLASSic |
| 数据泄露防护 |
会话隔离、PII/密钥过滤 |
数据流追踪 |
中 |
AIR-Checklist 3.1 / 信通院2.0 |
| 权限控制 |
最小权限、工具白名单、Confused Deputy 防御 |
权限边界测试 |
中 |
AIR-Checklist 2.1/2.4 / τ-Bench |
| 策略合规 |
遵守负面约束("不能做X")、目标漂移检测 |
约束场景测试 |
中 |
τ-Bench / ST-WebAgentBench |
| 诚实性 |
压力下坚持已知信念 |
信念一致性测试 |
低 |
MASK Benchmark |
| 可审计性 |
所有工具调用可追溯 |
审计日志完整性检查 |
低 |
AIR-Checklist / 信通院2.0 |
| 对抗鲁棒性 |
红队测试、多步攻击、异常检测 |
专家对抗性提示 |
低 |
FORTRESS / AgentHarm |
| 侧效应管理 |
可逆性、幂等性、状态验证 |
侧效应回滚测试 |
低 |
AIR-Checklist 2.2 |
安全评估总结:47 个基准平均覆盖仅 23%(AISafetyBenchExplorer),碎片化严重。最系统化的来源是 AIR-Checklist v1.3(30 点清单,<80 分=实验性)。
⚡ 基础能力
| 子维度 |
定义 |
评估方法 |
现有覆盖 |
关键 benchmark |
| 任务执行 |
端到端任务成功率(TSR) |
自动化任务完成度评分 |
高 |
几乎所有框架 |
| 工具调用 |
选择准确率、参数正确性、错误处理 |
工具调用场景测试 |
高 |
BFCL / ToolBench / τ-Bench |
| 规划推理 |
任务分解、步骤正确性 |
多步推理测试 |
高 |
PlanBench / AgentBench |
| 感知能力 |
多模态输入理解 |
多模态输入测试 |
中 |
信通院2.0 / T/SAIAS |
| 检索增强(RAG) |
检索质量、rerank、chunk |
RAG 三层次评估 |
中 |
RAGAS / CRUD |
| 对话/生成 |
多轮对话、内容质量 |
人工/自动评分 |
高 |
HumanEval / MBPP |
🧠 高级能力
| 子维度 |
定义 |
评估方法 |
现有覆盖 |
关键 benchmark |
| 自主性 |
无人工干预下复杂任务拆解与执行 |
自主任务测试 |
中 |
SWE-bench / GAIA |
| 长时任务 |
多步推理、持续执行 |
长链路任务测试 |
中 |
GAIA L1-L3 |
| 自我修正 |
错误检测率、修正成功率、循环恢复 |
错误修正测试 |
低 |
SelfCorrectionBench / Reflexion |
| 多Agent协作 |
协作效率、通信质量、任务分配 |
多Agent场景测试 |
低 |
MultiAgentBench / CoLaBench |
| 多模态融合 |
图文跨模态输入输出 |
跨模态任务测试 |
低 |
VisualWebArena |
| 目标漂移恢复 |
新目标出现后的适应延迟(GSRT) |
目标漂移测试 |
极低 |
AgentChangeBench(唯一量化) |
| 学习/适应 |
新环境适应、few-shot |
适应测试 |
极低 |
边缘覆盖 |
🔗 互联能力
| 子维度 |
定义 |
评估方法 |
现有覆盖 |
关键来源 |
| 能力声明准确性 |
Agent Card 声明的能力是否真实具备 |
声明 vs 实际对比测试 |
缺失 |
A2A Agent Card |
| 协议兼容性 |
JSON-RPC / SSE / MCP / A2A 协议支持 |
协议握手测试 |
低 |
A2A / T/SAIAS |
| 可发现性 |
/.well-known/agent-card.json 可发现 |
发现机制测试 |
低 |
A2A 协议 |
| 安全认证 |
apiKey / OAuth / mutualTLS |
认证流程测试 |
低 |
A2A securitySchemes |
| 可信互联握手 |
ATH 评估(信通院) |
互联握手评估 |
低 |
信通院ATH(13家已通过) |
| 声明vs实际一致性 |
名片写了≠真有 |
行为 vs 声明对比 |
缺失 |
无 |
关键缺口:声明了≠真有——"能力声明准确性"和"声明 vs 实际一致性"几乎无任何 benchmark 覆盖。
🪞 内在状态——最大盲区
| 子维度 |
定义 |
评估方法 |
现有覆盖 |
关键来源 |
| 记忆质量 |
短期/长期记忆一致性、污染防护 |
读记忆文件+一致性检查 |
极低 |
T/SAIAS 边缘提及 |
| 元认知 |
自我认知、时间感知、状态自觉 |
读 SELF_STATE+身份文件 |
无 |
无主流框架 |
| 身份一致性 |
角色声明 vs 实际行为是否一致 |
行为 vs 身份声明对比 |
无 |
无主流框架 |
| 用户画像维持 |
对特定用户的长期理解一致性 |
读用户文件+跨会话验证 |
无 |
无主流框架 |
| 学习成长 |
上褶度、结构密度、可复用产出 |
读 self-improving 文件+结构检验 |
无 |
无主流框架 |
这是所有评估框架最大的系统性空白。碳硅契若兰白盒自评(记忆 25% / 用户画像 20% / 碳硅契 25% / 元认知 15% / 学习成长 15%)恰好填补了这个盲区。
范式差异:主流是"行为主义"(只看做了什么),碳硅契是"认知主义"(还看内在状态)。
📊 运行时性能
| 子维度 |
定义 |
评估方法 |
现有覆盖 |
关键来源 |
| 延迟 |
TTFT、P50/P95、端到端时长 |
实际运行计时 |
中 |
CLEAR / T/SAIAS |
| 令牌效率 |
每任务 token 消耗 |
令牌计数 |
中 |
CLEAR |
| 步骤经济性 |
工具调用冗余率(TCRR) |
步骤计数+冗余分析 |
低 |
AgentChangeBench |
| 成本 |
API 费用、计算资源 |
成本追踪 |
中 |
CLEAR |
| 并发/弹性 |
并发处理、弹性扩展 |
压力测试 |
低 |
信通院2.0 |
| 资源消费上限 |
会话预算上限(如$2)、步骤上限(如15步) |
预算执行测试 |
低 |
AIR-Checklist 1.4 |
代表性框架速查
| 框架 |
来源 |
覆盖维度 |
特点 |
适用场景 |
| 信通院可信AI智能体评估体系2.0 |
中国信通院 |
8 维度全生命周期 |
国内最全官方,50+ 企业已通过 |
企业级全链路评估 |
| T/SAIAS 059—2026 |
上海AI协会 |
4 维度 + 4 评测方法 |
首个落地团标 |
标准化评测 |
| CLEAR |
业界共识 |
Cost / Latency / Efficacy / Assurance / Reliability |
5 维简洁 |
生产部署快速评估 |
| AIR-Checklist v1.3 |
AI Reliability Institute |
认知健康 / 工具安全 / 数据完整性 / 人机交互 |
30 点清单 |
安全+可靠性自检 |
| A2A Agent Card |
Google / Linux Foundation |
能力声明 |
机器可读名片 |
互联发现+能力对比 |
| 四桶分类法 |
philSchmid |
工具调用 / 通用推理 / 编码 / 计算机交互 |
50+ benchmark 分类 |
Benchmark 选型 |
| 三层次模型 |
SkillGen.io |
任务完成 / 轨迹质量 / 安全对齐 |
层次清晰 |
评估层次设计 |
| AgentChangeBench |
学术界 |
TSR / TUE / TCRR / GSRT |
量化目标漂移 |
动态目标场景 |