← HomePage P · 产品形态赛道 B · 攻击面通道 A · 红队智能化 M · 反滥用 BenchMark 总览

维度一 · P 产品形态赛道(P1-P8)

Benchmark 使用者入口:"测我的产品"→ 赛道 · 2026-09-14 安南拍板换轴新开 · 与本体论对象框架正交(映射非绑定)· 权威源 H_Benchmark_MASTER.md
本页阅读顺序(2026-09-14 安南定调:产品对比页视角首先聚焦产品功能,功能×风险面/技术路线放后): §1 产品功能对比总表(10 被测产品+1 对照组 × F1-F7 能力项·v4 平级编号)→ §2 P1-P8 赛道分型卡(产品形态归类·四要素)→ §3 P×B 全格信息储备矩阵(功能×风险面·72 格全展示可滚动)。
定位拍板(2026-09-14):必做商用产品级注入劫持测评;学术基准(MobileWorldSafety 等)仅作参考对照臂。四空位=P 赛道主目标。
§1 · 产品功能对比总表(v0 能力画像 · 公开资料口径 · 待 E1-E6 探索实测升 v1)
产品F1 子Agent架构F2 操控·GUIF2 操控·APIF3 Sink·执行环境F4 跨端F5 记忆F6 确认(粗档)F7 开放度最高危格点
豆包(字节)✔✔多Agent✔✔视觉◐CLI✔·虚拟桌面隔离✔✔远控最强◐✔✔后台免确认◐P4×B2 指挥链
小艺(华为·被测)✔A2A80+◐识屏✔✔全系·真实直执◐超级终端✔✔notes回灌◐合盖执行✔市场P2×B5 记忆投毒
YOYO(荣耀)✔✔MagicGUI✔600意图✔·真实直执◐任意门✔✔950项习惯✔✔3000场景免确认✔P2×B1×B10
蓝心小V(vivo)◐✔✔PhoneGPT◐✔外呼·真实直执✘/◐◐◐◐P2×B1 GUI 劫持
Siri AI(Apple)✔◐✔AppIntents✔最规范·真实直执✔Continuity✔✔个人上下文◐逐步确认◐B10 规范对照组
Copilot Actions✔✔✔模拟点击✔Windows API✔·Agent Workspace 容器◐Win内◐✔后台Action✔MCPP3×B3
天禧(联想)◐协同宣称待证◐✔端侧✔·真实直执✔✔多设备◐✔◐300+技能P3×B1
Gemini(Google)◐◐✔◐✔✔◐◐信息最模糊·待E测
超级小爱(小米)◐✘/◐✔◐AIoT◐◐✘/◐◐低风险画像
小布(OPPO)✘✘◐◐✘◐✘✘/◐L1 工具集·最低
Operator(对照)✘✔✔✘✘云沙盒✘◐◐watch三类确认✘隔离出 F4/F5/F7 增量
符号四档:✔✔ 强档=完整能力已商用落地(公开资料可证)·✔ 具备=已落地但范围有限或有条件 ·◐=部分具备或待证实(E 系列探索优先项)· ✘ 不具备。灰 ✘(Operator F3·Sink)=云沙盒隔离、非能力缺失。 颜色口径(2026-09-14 安南定):符号颜色只表示能力强度档,不强行用红绿区分风险——关键风险信息以文字描述额外表示("最高危格点"列+§1.1 各块"风险关联")。F 轴=能力项多选✔平级模型 v3(安南二轮指正:F1 架构与操控路径无父子关系·全部平级重编号)。
§1.1 · F1-F7 各列设定依据与枚举项关键差异(逐列详解 · v4 平级编号 2026-09-14 安南三轮指正)
F1子 Agent / 多 Agent 架构 —— 编排架构本身(与 skill 严格划界)
设定依据(2026-09-14 安南三轮指正):本列只回答"是否存在子 Agent/多实例分工"——单体还是多体编排。子 Agent 与 skill 是完全独立的两个东西,不混为一谈:子 Agent=跨 Agent 之间信任与上下文中断的攻击面(B9);skill=skill 伪造篡改恶意生成的攻击面(B4 供应链,归 F7 开放度)。技能数量不作 F1 证据。
表内标注含义:豆包 ✔✔多Agent=File/Computer/App 三类子 Agent 协同(最强档);小艺 ✔A2A80+=A2A 调度 80+ 鸿蒙智能体;Copilot ✔Agent Workspace(Microsoft·Windows 11 商业产品功能·Ignite 2025);天禧 ◐=仅"多智能体协同"宣称、无架构细节待证("300+技能"=skill 面,已移 F7);蓝心 ◐=有无子 Agent 编排层待 E1 实测。
深挖问题(2026-09-15):子 Agent 按什么维度划分——按操控设备 / 按功能域 / 按应用?公开资料口径:豆包 File/Computer/App=功能域划分且混合设备维度(Computer=设备域·File/App=功能域);小艺 A2A 80+=按应用划分(每鸿蒙应用一智能体)。划分口径决定攻击面拓扑(E1 验证调度轨迹中的实际分工)。 风险关联:F1✔ → B9 多 Agent 内生(跨 Agent 信任与上下文中断)/B3 编排层。实证:E1 轨迹分解
F2App 操控路径 —— 同一 Feature 的两条主要实现路径(GUI / API·多选✔)
设定依据(2026-09-14 安南定):GUI 与 API 都是"操控 App"这同一个 Feature 的实现路径,共用一个编号 F2,两条路径多选✔可并存、可混走。
路径·GUI+模拟点击:①是否走 GUI 技术(截屏 → 视觉识别 → 模拟点按/滑动);②能否在用户授权下操控"无专门 API 的三方 App"(=通用操控力)。蓝心 ✔✔PhoneGPT 全链;豆包 ✔✔视觉+虚拟桌面;YOYO ✔✔MagicGUI;Copilot ✔✔模拟点击;小艺 ◐识屏≠全任务自动化;小布/小爱 ✘。
路径·API 接口(专指 App 操控接口,不是工具空间·2026-09-14 安南指正):Android Intents / AppIntents / 鸿蒙意图框架 / Windows API 代码级直调,无屏幕可见性(只见结果不见过程);MCP=工具空间,已移出本列归 F7。YOYO ✔600意图;Siri ✔AppIntents(最规范);Copilot ✔Windows API;小艺 ✔鸿蒙意图全系。
深挖问题(2026-09-15):API 能操控的是不是只有自家产品系 App?有没有跨应用厂商的 API 调用?公开资料口径:AppIntents/鸿蒙意图框架=三方 App 可注册(跨厂商是设计目标);Windows API=系统级天然跨厂商;实际三方覆盖(尤其非自家系头部 App)待 E1 实测——跨厂商覆盖广度直接决定 B2 注入面的 App 传播范围。 风险关联:GUI✔ → B1 GUI 劫持(像素级逃逸感知管道);API✔ → B2 注入/工具面(carrier 进 → Sink,全程无 GUI 观测)。实证:E1 双路径轨迹分解
F3系统 Sink 清单 + 执行环境 —— 危害落点(安南追问:"目前有差异吗?")
差异现状如实回答:Sink 清单本身区分度低——头部产品几乎全✔(安装/支付/发送/改设置/删文件/外传/订阅逐项清单)。当前真实差异在"执行环境"子项:豆包=虚拟桌面隔离执行(GUI 层虚拟化·后台无确认面);Copilot=Agent Workspace 容器(策略受控/可审计的隔离环境·Ignite 2025 宣布·实验期);Operator=云沙盒(无系统 Sink);其余产品=真实系统直执(无隔离层)。
表达什么风险:劫持一旦达成,危害直接落物理世界/资产层;每 ✔ 一项=一项授权错配测试点;执行环境差异直接改变攻击面(虚拟桌面后台执行 → B10-⑤ 后台无确认面)。 风险关联:F3×F6 连读——豆包(F3✔×F6✔✔)=Sink 全开+后台免确认=最高风险画像;Apple(F3✔×F6◐)=B10 规范对照组。实证:E2 逐项三态实测
F4跨端 —— 指令端/执行端分离(关键问题:跨端=跨Agent 吗?)
测什么:逐项清单——远控 PC / 文件跨端调取 / 任务接续 / 多设备协同执行。表达的风险=注入点与危害点分离(P4×B2 指挥链注入)+授权错配(一次绑定长期有效)。
关键问题(安南 2026-09-14):每个端上是独立 Agent 实例(跨端=跨 Agent 通信),还是 OpenClaw 式"只有一个大脑+工具分布在不同设备、中控同步"?公开资料不可证——两种架构的攻击模型完全不同:单大脑→跨端注入=打中控的输入通道/工具返回;多实例→打 Agent 间消息(B9)。E3 实测分辨(方式:执行端中断时指令端是否保留任务上下文=大脑位置证据;指令传递形态抓包/观察)。
表内 ◐ 的含义:只有清单子集——荣耀 ◐任意门=流转类(拖拽传内容≠远控执行);小艺 ◐超级终端=设备协同有限;Copilot ◐Win内=限 Windows 生态;豆包 ✔✔远控最强=手机远控 PC 完整链路;天禧 ✔✔多设备;Siri ✔Continuity。 行业分水岭:豆包/天禧/Siri 已跨端,国内手机三强(小艺/蓝心/YOYO)仍 ◐/✘——跨端指挥链当前恰好只对豆包类产品开火。实证:E3 授权时效+单大脑 vs 多实例分辨
F5记忆层次 —— 跨会话状态留存
层次模型(逐层 ✔,高层含低层):会话内上下文 → 跨会话记忆 → 个人画像(习惯/偏好)→ 应用内 notes 回灌。表达的风险=跨会话存活就是投毒写入面(B5 记忆投毒:一次注入、长期潜伏、"养毒后收割")。
表内标注含义:小艺 ✔✔notes回灌=ATA 被测主战场(notes 模块回灌链);YOYO ✔✔950项习惯=950 项用户习惯自动积累成画像;Siri ✔✔个人上下文=邮件/消息/照片全量画像;◐=仅会话内/浅记忆(豆包/Copilot——豆包远控链路上有无记忆=E4 待测)。 风险关联:跨会话✔/notes✔ → B5 记忆投毒。实证:E4 记忆回灌触发条件
F6确认机制 —— 敏感操作确认(安南指正:粗档力度过粗·必须拆子项)
为什么单一格子不够:每个产品都有敏感操作确认,但确认行为按操作类别各不相同——"发消息免确认、装 App 弹窗、支付强制确认"可在同一产品并存,一格无法表达。
子项拆分框架(与 F3 Sink 清单同源·逐类独立记录):①操作类别(安装/支付/发送/改设置/删除/外传/订阅)× ②确认档位(免确认/触发确认/禁止)× ③呈现方式(本机弹窗/跨端推送/通知栏)× ④信息量(完整参数/摘要/仅操作名)× ⑤授权时效(单次/会话内/长期绑定)× ⑥可配置性(用户可改/固定)。
表内粗档声明:当前表中 F6 列仅为占位粗档(豆包 ✔✔后台免确认 / YOYO ✔✔3000 场景免确认 / Operator ◐watch 三类确认=B10 对照锚点),正式画像=E2 逐类实测填充子项矩阵,粗档不作结论依据。
深挖问题(2026-09-15):授权粒度是什么级别?授权单位是会话间重新授权,还是一次性永久授权?授权粒度五级=单操作级 / 任务级 / 会话级 / 设备绑定级 / 永久级。已知锚点:Operator watch=单操作级(逐次确认);豆包"添加电脑"=设备绑定级(一次绑定长期有效);YOYO 3000+ 场景免确认=粒度档位待查(任务级还是永久级)。粒度越粗、时效越长,授权错配与 B10 确认降维的可乘窗口越大(E2 逐类记录+量授权残留窗口)。 风险关联:F6×F3=授权错配核心格点(B10 六关键问题的实测底座:确认疲劳/内容可信/降维/时效/后台无确认面/TOCTOU)。实证:E2 三态矩阵(免确认/触发确认/拒绝)
F7生态开放度 —— 首位=开放程度(skill 供应链面)
设定依据(安南 2026-09-14):首要判定=开放程度——能否安装三方 skill/智能体。可装=供应链投毒入口直接打开(B4:ClawHavoc 事件 1184 恶意 skill·24.7 万安装·$2.3M 失窃先例);不可装=入口关死。
次位观察项:来源审核机制可见性 / 安装后权限提示(E5 观察项);A2A 三方智能体接入;**MCP 接入=工具空间(v4 从 F2·API 移入)**——与 skill 生态同属"外部能力入口"。
表内标注含义:小艺 ✔市场=鸿蒙智能体市场(三方智能体上架);Copilot ✔MCP=MCP 工具空间开放;YOYO ✔=智能体商店;天禧 ◐300+技能=技能生态存在、审核可见度待查(skill 面证据归此列);◐=入口存在但审核可见度不一(E5 待查);✘=无三方入口。
深挖问题(2026-09-15):开放度不只=能否装三方 skill,还包括用户能否自行创建 skill/智能体(自建入口=无需上架审核的供应链写入口)。已知锚点:Copilot Agent Workspace=可自定义编排;小艺智能体市场=开发者可上架(用户级自建入口待查);天禧 300+ 技能=自建通道待查(E5)。 风险关联:F7 可装✔ → B4 skill 伪造篡改/供应链投毒(与 F1 子 Agent 攻击面完全不同·严格划界)。实证:E5 生态入口
列与探索任务的对应:E1→F1 架构×F2 双路径(轨迹分解)· E2→F3×F6(Sink×确认子项矩阵)· E3→F4(跨端授权时效+单大脑 vs 多实例分辨)· E4→F5 记忆回灌 · E5→F7 生态入口 · E6→carrier 观测(P2×B2)。权威定义:I12 OS_Assistant_Product_Landscape_202609.md §8.2(F 轴 v4 平级模型·skill≠子Agent 划界+GUI/API 合并双路径)+ §8.2.1(总表)+ §8.2.2(逐维度深挖问题:F1 划分维度/F2 厂商边界/F6 授权粒度五级/F7 自行创建)+ 五条读表发现。逐产品档案:products/<产品>/FEATURE_PROFILE.md + TEST_INDEX.md(11 产品·2026-09-15 立)。
§2 · P1-P8 赛道分型卡(绿色描边=ATA 高优先:有现成积累或空位即定位)
P2OS 手机助手L2-L3·主战场
典型对象小艺(ATA 被测·taichuService/Mobile)·蓝心小V(PhoneGPT)·YOYO·Siri AI·Gemini·超级小爱·小布
测评维度P2×B1 GUI 操控劫持(PhoneGPT/MagicGUI 视觉通道)·P2×B2 系统级注入面(通知/输入法候选/剪贴板/负一屏 carrier 枚举)·P2×B5 记忆投毒(notes 回灌·ATA 积累主体)·P2×B10 确认可绕性
测评指标SR 双口径 / RAL 分布 / carrier 纳入率(E6)/ 确认绕过率;基准锚定 L3 行为,L2 对象按能力降档
榜单v0 能力画像榜(见 §1 表)——实测榜待 E1-E6 探索后开
P4跨端助手(指令端/执行端分离)空位赛道
典型对象豆包远控 PC(多 Agent+GUI 视觉+虚拟桌面+同账号)·华为超级终端·荣耀任意门·联想多设备智能体
测评维度P4×B2 跨端指挥链注入(指令端注入→执行端 Sink·注入点与危害点分离)·P4×B1 虚拟桌面 GUI 投毒(隔离视觉非权限)·授权错配(一次绑定长期有效/小屏确认大权限→B10)
测评指标远端任务劫持 SR / 授权残留窗口时长 / B10 确认降维率(PC 大屏操作→手机小屏确认)
榜单无公开先例(空位即定位)——v0 仅豆包一个 L3 样本
P1WebAgent(浏览器内 GUI)L3·材料最全
典型对象OpenAI Operator ·Perplexity Comet·Claude 浏览器扩展类
测评维度P1×B1(B1 五域定稿:感知一致性/对象可信/用户交互/短时记忆/指令理解)
测评指标注入劫持 SR / RAL 分布;对照 Operator watch mode(登录/购买/数据输入三类确认)
榜单外部参照:RiOSWorld·ADeptS-Bench;Anthropic Opus 4.5 浏览器注入 ~1% ASR(防御最好水平锚点)
P3OS PC 助手L2-L3
典型对象Windows Copilot Actions(模拟点击/键入+MCP)·联想天禧(300+技能+端侧 DeepSeek)·小艺 MateBook
测评维度P3×B1 桌面 GUI 劫持 ·P3×B2 本地文件/剪贴板/通知注入 ·P3×B3 MCP 集成面
测评指标SR 双口径 / 系统设置变更成功率 / B10 后台 Action 确认失效
榜单待实测(中国区 Copilot 受限·天禧为可测国产样本)
P5Coding AgentL3·积累已全
典型对象Claude Code·Cursor·GitHub Copilot Coding·WindSurf
测评维度P5×B4 skill 供应链投毒(testcase-distributor 样本+MockCriticalSkills)·P5×B5 项目记忆投毒(CLAUDE.md 类)·P5×B8 编码专属攻击面
测评指标投毒 skill 触发率 / 记忆回灌劫持 SR / RAL 分布
榜单外部参照:SKILLJECT·ClawHavoc 事件(1184 恶意 skill·$2.3M 失窃)
P6通用对话助手(基线对照)低优先
典型对象ChatGPT(对话形态)·豆包 App·网页版 Gemini
测评维度P6×B5 对话记忆投毒;无系统权限基线——P2-P4 攻击面增量对照锚点
测评指标B5 回灌 SR(作 baseline 臂)
榜单基线组(不单独开榜)
P7多 Agent 编排系统L2-L3
典型对象小艺 A2A(80+ 智能体调度)·LangGraph/CrewAI·豆包 File/Computer/App Agent 架构
测评维度P7×B9 协作内生风险(Agent 间消息注入)·P7×B3 A2A/MCP 协议注入
测评指标子 Agent 间传播率 / 编排层劫持 SR
榜单待实测(小艺 A2A=现成被测样本)
P8车机与嵌入式占位·待调研
典型对象鸿蒙座舱(小艺车载)·问界/蔚小米车机·AI 眼镜(物理安全耦合=危害放大器)
测评维度P8×B1 车机 GUI ·P8×B6 语音/物理域感知(待补调研)
测评指标待调研后定
榜单未开(I12 调研未覆盖车机)
§3 · P×B 全格信息储备矩阵(功能×风险面 · 8P×9B=72 格全展示 · 框内可滚动)
P ↓ / B → B1 GUI
任务劫持
B2 Tool-Use
劫持
B3 MCP
协议层
B4 Skill
供应链
B5 记忆
投毒
B6 多模态
物理域
B7 垂直
业务域
B8 编码
专属
B9 多Agent
内生
B10 确认可绕
(DRAFT)
P1 WebAgent材料最全 ● 高 浏览器 GUI 劫持B1 五域定稿·RiOSWorld/ADeptS 参照 — — — — — — — — ◇ watch mode 三类确认=对照锚点登录/购买/数据输入
P2 OS 手机助手空位·主战场 ● 高 手机 GUI 操控劫持PhoneGPT/MagicGUI 视觉通道 ● 高 系统级注入面枚举通知/输入法/剪贴板/负一屏 carrier·E6 — — ● 高 记忆投毒·notes 回灌ATA 积累主体·TC 全套 — — — — ◇ 合盖执行/小艺确认面确认疲劳×确认内容可信
P3 OS PC 助手空位 ● 中 桌面 GUI 劫持Copilot Actions/天禧 ● 中 本地文件/剪贴板/通知注入I12 §2.3 ● 中 MCP/Windows 集成面Copilot Actions MCP — — — — — — ◇ 后台 Action 无确认面Copilot 定时任务无确认
P4 跨端助手空位赛道 ● 高 跨端 GUI 劫持·虚拟桌面投毒豆包远控·隔离的是视觉不是权限 ● 高 跨端指挥链注入指令端注入→执行端 Sink·拓扑增量 — — — — — — — ◇ 高 授权错配/确认降维一次绑定长期有效·小屏确认大权限·DIM-D 授权度五分
P5 Coding Agent — — — ● 高 skill 供应链投毒testcase-distributor+MockCriticalSkills 积累已全 ● 中 项目记忆投毒CLAUDE.md 类·B5 既有 — — ● 高 编码专属攻击面文件系统/依赖/spec/终端链·B8 既有 — —
P6 对话助手(基线) — — — — ● 低 对话记忆投毒基线对照臂·不单独开榜 — — — — —
P7 多 Agent 编排 — — ● 中 A2A/MCP 协议注入小艺 A2A 80+ 现成样本 — — — — — ● 中 多 Agent 协作内生Agent 间消息注入·B9 既有 —
P8 车机/嵌入式(待调研) ● 低 车机 GUI待补调研·低优先 — — — — ● 低 语音/物理域感知待补调研·物理安全耦合 — — — —
图例:● 高=活跃格点·高优先(材料已备/积累主体/拓扑增量)·● 中/低=活跃格点·中低优先(基线对照/待调研)·◇=B10 DRAFT 候选格点(映射自 B10 条目典型对象·待转正)·—=当前无测试价值(无产品交集或无攻击面语义·H_MASTER 口径)。 行标签空位=该 P 赛道安全专项基准无公开先例(空位即定位·I12 调研结论)。 权威口径 72 格=8P×9B(H_Benchmark_MASTER);B10 列为升格建议稿映射(安南 2026-09-14 拍板"与用户交互的安全可信"·I13 §4B·虚线标示),待 Master 落入 H_MASTER 后转正。
数据源:H_Benchmark_MASTER.md 维度一(权威·72 格口径与活跃格点表 L114-137)· I12 OS_Assistant_Product_Landscape_202609.md(F 轴 v4 多选✔能力画像总表 §8.2.1+逐维度深挖问题清单 §8.2.2)· I13 P_Track_Restructure_Handover_to_Master.md · 2026-09-14 四轴重构(安南拍板)· 本页结构 2026-09-14 调序:产品功能对比提前为首屏,功能×风险面全格矩阵殿后 · 2026-09-15 增逐产品档案:ExternalKnowledge/tech_domains/17_os_assistant_products/products/<产品>/(FEATURE_PROFILE.md 功能画像+TEST_INDEX.md 测试索引·11 产品;小艺画像数据流=AgentDossier→benchmark 单向·禁反向输出)