探讨背景:随着大模型DeepSeek、Qwen等技术快速发展,以及近期OpenClaw与大模型协同,推动传统人工运维、被动故障处置向智能感知、自动诊断、预测预警、极简运营全新模式转型。随着企业业务规模持续扩张,网络架构日趋复杂、设备体量不断增大,业务对网络高可用、低时延、快速排障、降本增效与安全可控的诉求愈发强烈。以下是部分精选回复,欢迎大家继续探讨: Q:【开放题】您希望智能体如何协助优化安全策略内容?摘选回复一:【1】采集用于数据分析、流量关联的各类有效数据,包括:NetFlow、会话日志、告警日志等等;【2】基于数据驱动的策略血缘回溯,并关联业务进行分析;【3】基于分析结果进行策略优化,包括优化冲突策略、冗余策略、模糊策略等;【4】对优化后的策略进行合规性和安全性审查,确保各类策略满足最小权限原则以及等保3.0要求; 摘选回复二:一、智能风险评估,解决“不敢删除”的痛点,标记高风险策略,给出仅禁用,逐步下限,保留观察建议,不一刀切,模拟删除影响,预判删除会不会影响现有业务、专线给出低风险可删除清淡。二、策略精简合并优化,自动合并重复、网段、端口重叠的多条零散策略,梳理策略顺序不合理,宽松策略在前,智能推荐最优排序。 摘选回复三:希望通过智能体的接入,可以正确的梳理网络策略,直观明确每条链路的使用情况,结合安全扫描工具,通过运行与自我学习机制,可以申请一个网络基线,自主识别风险点及提供整改意见,定期输出安全报表。 摘选回复四:1、首先智能体可以能识别朱来哪些安全策略属于无用的僵尸策略,这部分策略可以零风险的自动删除;如果属于冗余策略、冲突策略可以标记出来建议操作,供管理员审批来执行删除动作;2、如果是工作中的策略可以能分析其关联的业务场景与访问流量,评估策略优化调整/删除的业务影响;3、生成合规的优化建议(如合并冗余策略、调整优先级、清理过期规则等); 摘选回复五: 1.通过分析已有的安全策略,提示用户相同或者相似的安全策略进行合并,提示用户有冲突的安全策略进行修改或者删除,提示用户长期(超过半年没有用过的安全策略)未用策略或者过期的策略是否进行删除。 2.以可视化报告显示每个策略的使用频率以及触发安全策略的威胁分布以及触发的威胁种类。 3.用户用自然语言告诉智能体要实现的安全策略,让智能体去自动创建对应的安全策略。 4.使智能体能够支持安全策略的仿真验证,也就是写完后验证这个安全策略实际是否可以生效运行。 Q:【开放题】您对网络运维智能体的期望或设想是什么?摘选回复一:背景:不少已经采用了省城商联盟的运营模式,采用数据中心集中建设、成员行共享服务的形式,核心数据中心的架构设计、变更规划、核心运维由联盟总部的专业团队统一负责,地市级成员行不参与核心侧的架构和变更设计;银行只有部分自有的个性化业务才会采用本地自建数据中心。所以一个地市级的银行的运维团队会有两个维度,一线负责本地分支网点的网络监控、专线/网点设备故障排查;二线则对接联盟运维团队,处理因核心侧变更/故障导致的本地业务问题,传递故障信息、配合验证恢复。基于这种运营模式下,我对网络运维智能体的期望或设想是:一、网络运维智能体可以实现跨站点、跨层级的业务质差智能分析和排障:假如某地市的城商行的下属网点反馈“柜面业务办理卡顿、交易超时此类问题”,如果按传统的报障流程,网点通常没有运维人员,所以需要市级主管的运维人员去拉取网点交换机日志、专线监控、上行接入路由器的流量日志,如果自身系统排查没有问题的话还要拉通城商联盟核心运维、运营商链路服务人员来多方沟通,这样一来往往要几小时才能定位根因,期间网点业务会一直受影响。1、如果运维智能体的落地,比如在网点的终端部署运维智能体agent可以从从末端实现业务逐级拨测,运维管理端也能自动拉取跨域的相关运行数据而无需人工操作、自动调取各类日志,最后通过大模型做关联分析,直接定位根因,这样就可以将原本需要几个小时的故障定位时间,缩短到几十分钟内,解决跨层级、跨部门的沟通成本,大幅降低业务中断时长。二、网络运维智能体可以实现数据中心网络变更风险的智能管控:银行金融行业中,如果涉及到调整骨干广域网、核心交换机的路由策略等配置,按传统流程评审就需要1-2周,人工来评估变更的风险,且仍会存在漏评估、误评估的风险,一旦变更出错,会影响关键的金融业务。1、期望智能体的落地可以自动梳理现网拓扑,基于银行数据中心的流量模型、成员行的业务路由拓扑,自动模拟变更后的路由走向,识别一些变更的风险,如:哪些成员行的业务流量会出现路径切换、哪些业务系统的访问会受影响、是否存在路由黑洞、流量拥塞点等隐患;并能自动生成变更风险评估报告,标记一些高风险的变更配置,同时给出回退预案。2、实现变更后的自动验证,而不需要工程师去逐个验证,或者白天业务上班后靠柜台反馈;变更执行后,智能体自动对所有成员行的核心业务做拨测验证,生成验证报告,无需人工逐个确认,同时同步给合规审计部门留痕。三、对一些安全设备、网络设备ACL等做僵尸策略智能治理,解决策略不敢删、没人敢碰的痛点:银行的数据中心出口、骨干核心设备等经过多年的迭代、业务累加,肯定积累了成百上千条历史策略,难免会有僵尸、冗余、错误的规则策略等,期待智能体可以实现全量策略的自动扫描,自动分析所有防火墙策略的命中日志、业务访问行为等,并给出业务影响评估和分级治理的建议。四、面向地市成员航、支行和末端网点实现轻量化自助运维助手:地市级农商行的科技团队规模小,网络运维人员往往身兼数职,遇到运维和故障问题时的处理效率偏低,期待智能体实现智能体agent,能够面向末端网点和非专业运维人员实现自然语言交互问答:本地人员可以直接用日常语言提问,比如“网点柜面xx业务失败,怎么排查?;业务办理卡顿、交易超时怎么排查哪里的问题等”,智能体自动调用知识库,给出分层排障指引和帮助。这样可以降低地市成员行的运维门槛,减少对联盟总部的依赖,提升问题处理的效率。 摘选回复二:1、变更配置自动生成。比如防火墙策略添加,只需上传模板文件,自动生成相关业务区域防火墙可执行的脚本。再比如交换机业务配置,设备扩容开局等,直接生成相关配置脚本。2、故障根因分析。比如针对某个告警,给出解决方案,或者针对描述的某个故障场景,给出可能导致的原因,方便运维同事直接排查。比如某个互联网业务突然出现某一只交易不通或者运行缓慢,但是其他同样路径下其他业务是好的,这种情况下给出可能导致的原因,方便去排查,比如光接口中断了,可以直接判断出是本端设备模块有故障还是对端设备光模块有故障。3、故障处理。在一些固定的场景下,可信的情况下直接进行故障处理,比如分支机构双链路,其中一条链路频繁闪断,影响业务,直接将该专线暂时中断或者降级,将业务切换至另外一条链路。比如专线中断,可以直接向运营商进行申告处理。4、告警整合过滤。对一些告警能够进行关联分析和整合。比如服务器宕机导致多条网络中断的告警,可以直接进行网络告警整合过滤降噪,无需派发多条工单。5、防火墙策略配置。能够直接根据需求,关联不同业务区域的不同品牌的防火墙,进行业务下发,或者经过运维同事审核后进行下发,无需运维人员过多的登录设备进行重复操作。6、日志分析。能够进行一些故障场景的判断,提前预判故障,以及设备冗余配置分析,优化。 摘选回复三:期望网络运维智能体是这样的:一、能智能监控,做到全监,起到眼睛的作用。监控主要在2方面,一是告警全量的监控,把交换机、路由器、防火墙、日审、堡垒机实现全量集中监控;二是监控性能状态(也就是现在大家都在推的健康度),做好预防性监控,提早发现光模块、板卡的故障,减少故障率。这部分对网络安全实际影响最大,也是最常态的网络工作状态,智能体要发挥价值,这个能看是很关键,也是价值的最重要体现。二、能自主故障处理,这个属于应急故障处理,通过智能体快速实现网络复通,可以提升客户满意度,缩短故障历时。其次能预测性故障处理,三、能自主优化:1、自主安全加固,例如在网络打通的情况下,对交换机、防火墙等设备的安全基线加固,提高安全基准(可以缩短交付和规避漏配);2、自主流量调优,实现流量均衡,保障业务时延;3、自主节能减排,例如对未用的板卡或者光模块可以内部断电,降低能耗,节约成本。这个属于加分项。4、自主网络优化,例如对交换机从接入层到汇聚层进行脚本配置的优化,减少脚本的臃肿;对防火墙策略的校核优化,删除无效的策略,便于维护和交付。5、自主配置交付,例如根据业务需求,自主配置从接入到汇聚核心的端到端自动化配置,缩短交付期。其实这个华为在光网络就交付过,但是存在不好用,与实际场景偏差的问题。自主交付核心在网络组网管理和开通规则。四、能与人多媒体互动:1、可以支持语音互动,就像请教老专家一样,语音互动交流,也可以智能文本问答,向chatgpt那样。2、能通过客户端基于维护工程师拍的图片、视频,进行ai识别分析,然后进行准确的理解分析。这个主要解决我们一线维护工程师能力不足,经验缺失的短板。 摘选回复四:在我的实际使用中,很多智能运维都是简答的根据配置好的规则,去发送告警短信。不具备对问题的分析及处置形成学习事件的闭环能力。我对网络侧运维智能体有如下几点期待:1、减少无效告警,如一些网络抖动。端口Err-Disable、BGP会话Down,可以自行处置及关闭。2、出现故障后,给出明确报错根因,或划定排查范围,减少人工工作及定位问题的时间。一些因变更引起的问题,可以使用在云端提前生成的回退方案,一建回退。3、提升学习与分析能力,持续分析网络状态,通过分析流量模型,建议调整路由策略或升级热力域的硬件。 摘选回复五:鉴于金融行业需满足的刚性安全合规、稳定连续的业务监管要求,金融机构数据中心的运维部门对智能体的期望,将紧密围绕 “绝对的安全管控”和“业务稳定性、连续性”等核心合规需求去建设和部署运维监控体系。包括但不限于以下方面:【1】业务变更场景下,基于智能体策略的安全合规审查。在进行业务系统环境变量配置变更、业务系统代码更新、网络设备配置变更、防火墙策略配置调整等变更操作执行前,基于智能体回溯比对之前的安全基线、代码基线、合规策略等业务变更上线审查,实现业务变更事前检测和预防,避免因人工配置错误导致的安全事件或合规缺失;【2】业务稳定性检测场景中,基于智能体数据驱动的业务运行仿真检测。业务变更上线前,执行智能体根据变更后上线的业务系统架构,自动执行模拟的故障注入仿真场景,采集从IaaS层、PaaS层、SaaS层各类相关的日志告警信息,分析告警数据,给出优化解决方案建议。实现业务变更过程中的被动应对变成业务变更前的主动优化,持续提升业务系统运行稳定性和连续性; 摘选回复六:对于网络运维智能体,希望能够帮助运维提升一个质化层级才有价值。具体来说,目前有以下的一些痛点:1、【场景】最常遇到的痛点场景就是服务台发现某个系统突发交易缓慢,通常告知的信息就是一个信息系统。然后就一堆人,开始一通查,首先还要问服务台是什么系统,IP是多少等等。一套流程走下来,实际上留给应急的操作时间实际上就不多了,要在规定的时间内定位出问题,恢复业务才是王道。【期望】基于以上场景,我希望智能体能够根据服务台给出的信息系统名称或者更少的信息秒找原因,缩短应急时间。更够给出准确的故障点,并给出处理建议,事后能够出一份复盘报告,评估故障的根因,后续如何预防的建议。2、【场景】很多时候网络支撑的是业务和信息系统,往上有服务器、操作系统、数据库、中间件、最终到应用、往下有基础设施,有接口、有硬件,有线路,而网络其实大部分时候不是独立于其他领域而存在 的。【期望】我期望这个智能体应该是能懂业务的智能体,能够从信息系统的角度,评估整个网络的健康情况。比如我输入我对信息系统的要求,它能够根据我的要求描绘整个信息系统的详细拓扑,评估信息系统是否存在瓶颈和单点,能够辅助我们进行系统的IT架构梳理。3、【场景】在银行系统中,很多信息系统的业务流量是有特定规律的,比如说每天的日终批量,每个季度的季度结息,每年的年终决算等等,并且很多设备运行规律也是有迹可循的。比如说固态硬盘的刷新次数,光模块功率的衰减、线路常年的疲劳,分支行运营商链路质量的降级等等。【期望】我希望这个智能体可以基于这些既有的规律,可以做到提前预判的态势感知,避免事后救火。4、【场景】在各种护网行动中,网络团队一直都是首当其冲的第一梯队,在网络安全方面投入大量的人力进行薄弱点加固,防火墙特征库升级等等。【期望】我希望智能体可以协助进行网络站岗,帮助进行网络边界的智能监控,一眼就看出异常流量,并且可以根据预设的规则,提示是否进行IP封堵,侦测跨安全域的异常访问,防止横向渗透。5、补充:银行对于数据安全要求极高,数据不能外流,内网系统严禁上公网,操作要留痕,全要要细分。智能体对于银行来说,一定是一个补充,绝对不可能完全依赖,因此智能体所有的分析,可以在授权范围内自动进行,但是对于操作,一定是可控的,经过确认和授权的。不能过于的“智能”。总而言之,我理解智能体对于银行而言,是一个懂得银行规矩,能看全网,能秒查故障,提前预防风险,减轻运维负担,帮单位过合规检查的专职网络专家。点此查看获奖名单