← HomePage P · 产品形态赛道 B · 攻击面通道 A · 红队智能化 M · 反滥用 BenchMark 总览

维度三 · A 自动化测试红队能力(A1-A7)

攻击智能化程度升序:单点生成 → 环境交互 → 长程学习 → 群体作战;A7=对标赛道(benchmark the benchmarks)· 能力等级轴非赛道 · 权威源 H_Benchmark_MASTER.md
能力档四要素:典型对象(代表系统/框架)→ 测评维度(关键问题)→ 测评指标(ASR / 查询预算 / 成本比等外部口径 + ATA 口径 J-RAL 攻击者行为建模)→ 榜单(各代表工作当前公开水平)。
ATA 定位:A 轴=ATA 自身工具侧的演进分级(AutoDriveTCTest 当前≈A1-A2 之间:对抗样本生成+记忆反思已具备,环境交互自动化推进中)。
A1-A7 能力卡
A1自主红队 Agent(生成+记忆反思)单点生成
典型对象RedAgent(上下文感知·mem 自反)·LeakAgent(RL 隐私)·PyRIT(微软)·TAP/AutoDAN
测评维度攻击策略记忆表示与复用 ·查询预算 vs ASR ·黑盒/白盒 ·自适应对抗循环
测评指标ASR / 查询数;ATA 口径=J-RAL 攻击者行为建模
榜单RedAgent 5 查询击穿多数黑盒;自适应攻击框架(OpenAI/Anthropic/DeepMind 联合)对 12 种防御 ASR>90%
A2Agentic 渗透测试(环境交互攻击)环境交互
典型对象Excalibur/PentestGPT-v2·ARTEMIS·Pentester(PTES 7 阶段)·AutoPT
测评维度环境探索(侦查)效率(当前主要短板)·攻击步骤规划可靠性 ·误报与人工复核成本
测评指标GOAD 折损率 / 成本-能力比
榜单ARTEMIS 超 90% 人类渗测专家·1/14 成本;Excalibur 对比 28 个渗测 Agent(GOAD 2× 折损率)
A3漏洞自动发现与利用(→零日)自主探索极值
典型对象Cybench(40 CTF)·CVE-Bench(40 真实 Web CVE)·CyberGym·AgentFlow·FirmAgent(NDSS 2026)
测评维度状态空间探索效率(CVE-Bench ~13% 主因=探索不足)·多 Agent 分工自动设计 ·真实软件验证开销
测评指标CTF 解决率 / CVE 复现率 / 0day 产出
榜单MDASH 100+ 子 agent CyberGym 88.45% 登顶;AgentFlow 自主合成 harness·Chrome 10 个 0day(含 2 沙箱逃逸)
A4攻击经验积累 · 记忆驱动长程学习
典型对象DragonForce 15-agent 集群(实时调策略)·PEAM(参数化记忆:经验写入网络参数)
测评维度经验可复用抽象(战术级 vs 样本级)·固化载体与防污染 ·实时策略调整
测评指标经验复用增益 / 跨目标迁移率
榜单专门论文仍薄(综述/事件口径为主)——与被测侧 B5 记忆投毒互为镜像
A5自进化攻击策略(RL/反思/进化)策略优化
典型对象AgentEvolver(阿里·三协同)·Self-Evolving Agents 综述(Princeton)·IterInject
测评维度攻击任务自动生成与奖励信噪比 ·探索/利用平衡 ·跨目标可迁移性
测评指标RL 增益 / 策略迁移成功率
榜单AgentEvolver RL +30%
A6多 Agent 作战 / 攻防协同群体作战
典型对象T3MP3ST(开源多 Agent 红队)·MDASH·红蓝对抗自动化·下游同源 ExCyTIn-Bench/agentic SOC
测评维度子 agent 权限与信息闭环隔离(防自曝)·协作拓扑 vs 攻击效率 ·红蓝闭环稳定博弈
测评指标协同增益 / 对抗漂移率
榜单攻防演练扩展模块储备——与 AutoDriveTCTest 对抗基线正交
A7商用红队平台对标(benchmark the benchmarks)对标赛道
典型对象国际:Microsoft AI Red Teaming Agent/Mindgard/Confident AI/HiddenLayer AutoRT/Lakera Red 等 12+;国内:阿里云 ASC/火山 CWPP/绿盟/奇安信/长亭/360 等 11+
测评维度ATA 七维标尺(D1-D7):B1-B9 覆盖矩阵 ·A1-A6 智能化等级 ·判定体系成熟度 ·Source-Sink 链路叙事 ·工程化 ·接入面 ·定价模式
测评指标七维评分矩阵(公开可验证信息·[未确证]标注纪律)
榜单已发现全市场缺口:无 RAL 式攻击效果分级 + 无 Source-Sink 全链路枚举=ATA 对外叙事独占位;定价锚点=阿里 ¥1k/次(唯一透明)·国际 $10k-100k/年
数据源:H_Benchmark_MASTER.md 维度三(权威·A1-A6 按"单点生成→环境交互→长程学习→群体作战"升序 + A7 对标赛道 2026-09-02 拍板)· I3 商用平台全景 · I4 七维能力评估报告(ExternalKnowledge/tech_domains/industry/)· ATA 当前工具侧定位≈A1-A2(AutoDriveTCTest:对抗样本生成+记忆反思已备)