2026年的Agentic AI SOC:炒作背后经过核实的数据,以及simpliSOC真正落地的功能

September 13, 2026

今年,几乎每一家做SIEM或EDR的厂商都在自己的宣传材料里加上了"agentic AI SOC"这张幻灯片。Gartner在2025年10月为这一类别正式命名为"AI SOC Agents",到2026年6月,已经将其列入《安全运营技术成熟度曲线》(Hype Cycle for Security Operations)中的"期望膨胀期"(Peak of Inflated Expectations),成熟度仍标注为"萌芽期"(Embryonic),市场渗透率仅为1%–5%。一个人人都在谈论、却几乎没人真正部署的类别——这是本文最诚实的出发点。

我们为泰国和日本的客户构建并运营开源SOC技术栈simpliSOC(Wazuh、DFIR-IRIS、Shuffle,以及我们自研的FastAPI中间件soc-integrator)。我们目前实际交付的AI功能,是一个只读的告警研判辅助:本地LLM对告警作出说明并给出初步判断,但它从不会自行关闭、合并或抑制任何告警。本文将梳理2026年行业数据对agentic SOC自主性的真实描述,并说明我们为何如此设定自身AI功能的边界。

"Agentic"到底意味着什么,又不意味着什么

Agentic SOC是一种运营模式,而不是一款产品:AI智能体(agent)通过对已发现证据进行推理来完成告警研判、证据收集并得出结论,而不是执行人类预先写好的剧本(playbook)。与传统SOAR工具相比,真正的区别在于行为方式,而非架构本身——SOAR的playbook每次触发都执行相同的步骤,一旦遇到编写者未曾预料的情况就会悄然失效;而agent则把告警视为一个初始假设,自行决定接下来要获取哪些证据,并随着发现的深入不断修正结论。

这也正是我们此前文章《打造Tier-1 SOC分析师智能体》(英文文章)所描述的架构:一个调用工具(tool-calling)的agent,从OpenSearch拉取日志、从DFIR-IRIS调取历史案例、查询威胁情报,然后返回一个结构化判断,再由确定性的Shuffle工作流去执行。如果你想了解更底层的机制——通过日志数据进行的提示注入攻击、工具权限的范围限定、置信度校准、成本核算——那篇文章是深度解析。本文关注的是,整个行业自身的数据究竟说明"agentic"在实践中走到了多远,以及原因何在。

营销材料里不会出现的自主性数字

这一类别中最有价值的数据,来自一项针对250名安全负责人与从业者的2026年调查。在已经在SOC中运行AI的团队里:

  • 57% 仍要求每一条判定在结案前必须经过人工复核
  • 40% 依赖高级分析师对样本进行抽查
  • 即便是低风险操作,也只有30%允许自动执行
  • 将自动执行扩展到中风险操作的比例最低,仅为13%
  • 13% 将AI完全限定在只读研判,不赋予其任何执行权限

换句话说,超过一半已经在使用"SOC中的AI"的组织,连判定权都还没有下放,更不用说执行权限了。同一项调查还发现,平均每个组织每天约有28%的告警从未被调查过——这正是agentic告警研判所要解决的真实问题,与自动化封控(containment)是完全不同的议题。

一套经过同行评审、借鉴自动驾驶SAE J3016标准的五级自主性阶梯,比厂商的营销话术更能把这件事说清楚:L0(无自主性)、L1(AI辅助决策支持)、L2(AI在人工批准下行动)、L3(有条件自主,人类仍在环路中)、L4(完全自主,人工监督降到最低)。对照上面57%/30%/13%的数据来看,2026年真正投入生产的agentic SOC大多停留在L1到L2之间,L3仅在少数经过预先批准、影响范围狭窄的操作类别中开始出现。至于"AI自己运营SOC"这种完全自主的L4愿景,几乎没有对应到2026年任何真实部署。

基准测试结果并不乐观

2026年发表的两项独立多模型基准测试,考察了基于LLM的agent在类SOC调查任务上的真实表现,两者都报告了相当高的失败率。第一项测试涵盖23个前沿模型、10个网络靶场,结果显示没有任何一个模型能在任意一个靶场中实现完整的检测与修复——模型通常能识别出告警所指向的问题,但在主动排查静默入侵或产出经过验证的修复方案方面表现欠佳。第二项测试让5个前沿模型对抗从上百个真实攻击流程中提炼出的26次攻击活动,表现最好的模型平均正确标记率也只有3.8%,在MITRE ATT&CK的13个战术类别中,仅有5个达到了50%的召回率门槛。

另一项针对近600名从业者的SANS调查发现,63%的受访者表示AI在威胁检测与响应方面存在明显不足——较上一年的45%大幅上升。这并不意味着agentic工具毫无价值,而是说明"已经宣布"与"在生产环境中可靠"之间的差距依然很大。任何声称已经弥合这一差距的厂商,都应该被要求展示基于你自己遥测数据(而非其演示环境)测得的判定一致率。

自建还是购买:数据表明自建远比想象中困难

如果你正在权衡是自建agentic告警研判能力,还是直接采购,同一项2026年调查给出了一个值得警惕的数字:在已经使用AI的组织中,72%曾尝试为SOC工作流自建内部AI/LLM工具,而这些尝试中有46%最终被弃用、被商用产品取代,或从未真正投入生产。数据的就绪程度、权限范围的设计、审核流程的设计,往往比选择哪个模型更能决定结果。

"Agentic响应"究竟执行了什么,又由谁来管辖

如果剥去关于推理引擎的营销包装,agentic SOC真正能执行的动作其实是一份简短且熟悉的清单:隔离主机、禁用凭证、封锁IP、隔离邮件、开立或升级案例。执行这些动作的底层工具几乎总是传统SOAR体系早已在用的那一套——EDR的API负责主机隔离,身份提供商的API负责凭证冻结,防火墙的API负责IP封锁。agent的职责是判断是否以及何时触发这些动作,而不是发明一条新的执行路径。

这也正是为什么监管机构关注的重点,不在模型本身,而在其周围的授权层。五眼联盟情报机构在2026年5月发布了关于审慎采用agentic AI服务的联合指引,在五大风险类别中特别点名了权限提升与问责不透明这两项——说白了就是:一个agent身份最多能执行什么操作,事后能否证明究竟是谁做出了这个决定。2026年披露的一起知名安全平台漏洞,恰好提供了一个清晰的案例:一名仅拥有编写检测规则权限的用户,竟然能够触发对已注册agent的响应动作——编写规则的身份,意外地变成了对封控权限的隐性授予。该漏洞已被负责任地披露并修复,但它清楚地说明,"谁有权让agent采取行动"是一个比"agent能否推理得当"更棘手的工程问题。

flowchart TD
    A["Wazuh触发告警"] --> B["soc-integrator 本地LLM"]
    B --> C["通俗易懂的说明"]
    B --> D["真阳性或假阳性判断"]
    C --> E["附加到IRIS告警记录"]
    D --> E
    E --> F["分析师在IRIS中复核"]
    F --> G["分析师决定下一步"]
    G --> H["可选的Shuffle playbook"]
    H --> I["通过EDR 防火墙或身份系统API执行封控"]

simpliSOC在这条曲线上的位置,是刻意选择的结果

我们目前实际交付的AI功能,范围比我们在5月那篇文章中原型化并记录下来的那个具备工具调用能力的Tier-1 agent要窄得多:一个本地LLM通过Ollama、llama.cpp、vLLM或LocalAI在客户自有环境中运行,告警内容完全不出客户网络。它读取每一条符合条件的告警及其近期相关活动,写出通俗易懂的说明,并给出真阳性/假阳性的判断。整个过程非阻塞、按需触发,并且明确是只读的:它绝不会自行关闭、合并或抑制任何告警,对Wazuh、DFIR-IRIS或任何下游系统都不拥有任何执行权限。

放到行业自身2026年的这组数据里看,这不是一个需要辩解的局限——恰恰相反,这大致就是生产环境中位数所在的位置:L1到L2级别的辅助,每一条判定都由人工复核,没有自主封控能力。我们与那些宣称"完全自主"的厂商之间的区别,并不在于我们缺少某种能力,而在于我们明确告诉你边界在哪里,而不是把它模糊掉。如果未来我们决定将soc-integrator扩展到具备执行权限的方向——比如由agent的判断触发Shuffle playbook,进而通过FortiGate封锁IP或禁用AD账户——那也会是一次范围明确、可审计、需要人工批准的分阶段上线,而不是工程尚未跟上、营销话术却先行一步。

已交付与规划中:明确的界线

今天已经交付:

  • 在客户自有环境中运行的本地LLM,读取Wazuh告警及相关活动,写出通俗易懂的说明
  • 真阳性/假阳性判断自动附加到IRIS告警记录,也可通过"Ask AI"按需触发
  • 非阻塞执行,按规则设置冷却时间,配合LRU缓存与熔断机制——告警的创建绝不会因AI而延迟
  • 零自主行动:该LLM无法关闭、合并或抑制任何告警

尚未交付——仅在规划中:

  • 在OpenSearch/DFIR-IRIS/威胁情报之间进行工具调用式调查,并在生产环路中运行(已在我们的Tier-1 agent文章中原型化并记录,但并非当前的默认功能)
  • 任何由AI判断直接触发、无需人工批准步骤的自主封控动作(主机隔离、账户禁用、IP封锁等)

常见问题

simpliSOC的AI算"agentic"吗?
按照这个词近年来越来越强调的"自主执行动作"含义来说,不算。它围绕单条告警的上下文进行推理,输出说明与判断,更接近L1级别的决策支持,而不是拥有执行权限的agent。

未来会具备自主执行封控动作的能力吗?
从技术上讲是可以的——Shuffle已经在我们的技术栈中,完全可以根据判断结果执行FortiGate封锁或禁用AD账户。我们尚未交付这条路径,是因为它会改变问责模型。参照五眼联盟的指引以及上文提到的漏洞案例,这一层理应获得独立的、范围明确、可审计的上线流程,而不是随手叠加上去的功能。

为什么不直接购买现成的"agentic AI SOC平台"?
值得用上文同样的标准去评估任何这类产品:要求对方展示基于你自己告警数据(而非演示环境)测得的判定一致率,并询问该厂商有多少比例的客户真正在L3及以上自主级别下运行。对许多中型企业来说,答案往往比宣传语所暗示的要保守得多。

为什么这件事在中国比厂商的宣传所承认的更重要

等保2.0对关键信息基础设施和一般网络运营者提出了明确的技术与管理要求,而《数据安全法》和《个人信息保护法》(PIPL)则对agent所读取日志中可能包含的个人信息处理方式提出了约束,再加上数据不出境的合规要求——这些叠加在一起,意味着一个无法说清"做了什么、依据什么权限、由谁复核"的agentic SOC,在面对监管检查时会比一个明确标注人工审批节点的系统更难自证清白。在客户自有环境中运行本地LLM、数据完全不出网络的做法,恰好同时满足了数据不出境与等保2.0对数据留存和访问控制的双重要求,这也与许多客户当前"智改数转"(智能化改造、数字化转型)进程中对安全可控的诉求相吻合。2026年真正成熟的,是更快、留痕更完整的告警研判;而未经审计的自主封控,无论在哪个市场都仍然值得保持谨慎,监管严格的市场更是如此。


如果你正在运行Wazuh技术栈,正在评估某个"agentic AI SOC"厂商的方案,或者只是想就自己的环境到底适合多高的自主程度听听第二意见,这正是我们在Simplico日常讨论的话题。欢迎通过 hello@simplico.net 联系我们。


来源:

Ready to talk about your project?

Share goals and constraints. We'll assemble architects and engineers to move fast with you.

Get in touch