探讨背景:随着Agentic AI快速发展及 openClaw热潮等,企业客户/伙伴对于通过运用AI大模型来辅助运维运营的诉求愈发挑战。以下是部分精选回复,欢迎大家继续探讨: Q:【开放题】关于智能问数(自然语言交互的现网信息查询),您希望它能回答哪方面问题?您会如何提问?列举出您可能的问法?摘选回复一:1、用于资产管理,例如统计现网有多少套存储、累计多少容量、信创占比有多少、数据库实例有多少?2、用于告警和故障,例如某某服务器或数据库过去24小时关联触发了哪些告警?3、自动化或执行建议类,现在请帮我分析一下IO打满的情况,我应该先处理哪些数据库实例?4、性能和状态类,比如对比上一周,这个数据库有哪些SQL语句的执行计划发生了变化? 摘选回复二:【日常通用运维信息查询类】【1】某IP:10.1.2.x是哪个业务系统的映射IP?【2】第三方渠道业务系统的运行状态如何?【3】当前L2及以上严重级别的告警信息有哪些?-------------------------------------------【定期巡检关键信息查询和生成类】【1】生成今天核心业务系统、一般业务系统巡检日报【2】生成对象存储池、分布式存储池的容量周报【3】日常巡检后,可能造成业务系统响应的告警有哪些? 摘选回复三:1.在设备运行状态上,我会问“某核心交换机当前端口状态是否正常”;2.资源使用情况方面,会问“过去24小时数据库服务器磁盘空间使用率变化趋势如何”;3.业务指标数据上,会问“本月线上交易系统成功交易笔数是多少”“某应用服务器近一周内存占用峰值出现在什么时候”“特定时间段内网络出口带宽的平均利用率”等。要问的其实很多很多,也希望能想智能体一样,可以逐步自学习和自我完善。 摘选回复四:1、昨晚谁修改了核心交换机的VLAN配置;2、检查核心交换机最近三天有没有人批量修改过ACL规则;3.把出口防火墙最近五次的策略变更记录调出来,包括操作人和变更内容;4.对比今天凌晨和昨天凌晨的BGP邻居配置,有什么差异 摘选回复五:【设备硬件KPI方面的问题】硬件是网络稳定的基础,实时查看硬件指标能提前发现设备风险,以便快速规避风险。1.帮我查询当前所有核心交换机的 CPU、内存、温度实时数据并当前硬件状态异常(CPU / 内存超阈值、温度过高)的设备,同时查询下各类表项规格和占用率,确认是否有超规格风险。2.查一下全网接入交换机近 24 小时 CPU 利用率的峰值和平均值,还有全网设备近期是否有重启记录,重启原因是啥?3.帮我查xx设备的所有接口光功率信息并给出收光功率最低的20个接口名称及他们所在的设备管理地址。4.帮我查全网接口带宽占用率75%的接口,并输出具体接口及设备名称。【异常流量类问题】广播风暴、未知单播泛洪会导致设备 CPU 冲高、内网延迟,是内网隐性故障的主要诱因5.帮我查询全网各 VLAN 的广播报文速率,确认是否存在异常泛洪。6.帮我查询当前CPU报文上送安全策略配置速率及当前arp报文上送速率和是否存在arp丢包,确认下arp上送是否超阈值,当前CPU上送速率是否会导致业务故障。7.帮我查询未知广播、未知单播和未知组播的速率,判断是否可能存在对设备的报文攻击。【无线体验与准入类问题】无线体验一直是最难定位的问题,常规场景下需要人到现场各种跑,通过查询可以做出对应的优化方案。8.帮我查24小时内终端漫游失败、乒乓漫游最多的区域和AP信息,同时查询24小时内终端接入最多的区域,看看是否与漫游体验差区域重合,分析是否是因为AP接入负载高引起漫游失败9.帮我查一下全网AP的终端接入信号强度、信道利用率、列出弱信号覆盖区域。10.帮我查一下该用户Mac是不是终端黑/白名单内?11.帮我查询24小时内终端接入准入失败的数量,并给输出具体准入失败原因。【日志/告警类问题】操作日志、告警等信息查询,常规查询异常繁琐且很难看懂,可通过只能问数进行快速查询和分析。12.帮我查询下当前所有设备的高风险及中风险告警,列出该告警的具体意思,并给出解决建议,另外筛选出ARP攻击、MAC漂移、环路等相关日志,提供对应的攻击者、漂移者 Mac地址和IP。13.帮我查询下当前防火墙xx策略是什么时候操作的,是哪个账号操作的,我需要进行溯源。14.帮我查一下是否存在固定时间固定出现的告警【用户相关信息查询】有线用户查询常规情况下需一层一层的查Mac,可通过该方式实现一键查询。15.帮我查一下IP为X.x.x.x 的用户在那一台交换机,mac为x-x-x-x的Mac从哪个交换机学上来的。【转发类问题查询】在防火墙查会话命令行晦涩难懂,是否在防火墙被丢包很难确认。16.帮我查一下x.x.x.x 在防火墙是否会被策略命中、帮我查x.x.x.x在防火墙是否存在会话表?是否被丢包?丢包原因是什么?17.帮我查一下NE路由器的NAT配置是否合理,是否存在x.x.x.x网段无法被NAT?【SD-WAN/VXLAN 虚拟化组网问题】SD-WAN 链路质量直接决定跨分支业务体验,实时查询隧道状态可快速定位广域侧网络故障,VXLAN 虚拟组网故障隐蔽性强,邻居震荡、泛洪未抑制会导致大二层网络异常。18帮我查询所有 SD-WAN 分支隧道的时延、丢包率、抖动,查看 SD-WAN 当前链路选路策略是否正常生效。19.帮我查询 VXLAN 隧道状态、EVPN 邻居是否正常建立,邻居建立失败原因是什么? Q:【开放题】若是提供对话式交互的健康检查(巡检)与健康评估报告生成能力,您会如何下指令?列举出您可能的描述。?摘选回复一:1. 指令描述:“请对整个校园网络核心层、汇聚层设备及无线覆盖区域进行全面健康巡检,重点分析CPU/内存利用率、无线丢包率、设备在线率,并生成一份包含风险隐患清单与优化建议的可视化评估报告。”2. 指令描述:“对存储阵列与监控NVR设备进行深度体检,检查磁盘健康状态、存储剩余容量、数据完整性,并输出存储容量扩容预警报告和数据安全风险评估。” 摘选回复二:若是提供对话式交互的健康检查(巡检)与健康评估报告生成能力,个人会这样下达指令:第一、查询所有设备的状态,同时分析可能发生的潜在风险?第二、做出基础环境设施、设备运行状态的分析表、统计图、趋势图?第三、快速备份设备数据。 摘选回复三:我会通过自然语言指令,如“对生产环境核心服务做全面健康检查,覆盖CPU、内存、服务状态和错误日志,今天下午5点前输出报告,标出异常和风险”“专项检查数据库集群,分析慢查询、连接数峰值和备份完整性,与上周数据对比”“设立每日自动巡检K8s节点资源,若内存使用连续3天超90%则告警并推荐扩容”“针对昨日订单抖动事件,关联检查相关中间件与依赖服务,输出健康快照对比报告”“检查核心链路用户体验健康度,按省份分析首页加载耗时与支付成功率,标记性能退化地区”或“分析云主机利用率,找出闲置超30%的实例并估算月度浪费成本”,来触发对话式健康检查与报告生成,并期望系统能自动执行检查、关联多源数据、对比历史基线,最终输出结构化的评估报告与优化建议。 摘选回复四:“对核心网络中的所有交换机执行一次标准健康检查,生成PDF报告,重点关注CPU、内存、温度和端口错包。”“帮我巡检光传输设备OSN 9800,检查光功率、误码率和保护倒换状态,如果发现异常直接标记出来。”“对存储阵列进行深度健康评估,包括硬盘SMART信息、控制器冗余状态、缓存电池寿命、性能阈值,输出按风险等级排序的报告。”“每周一早上8点自动对HIS系统所涉及的设备(列出设备组)执行健康检查,并将报告发送到我的邮箱。”“对比本周和上周的健康检查结果,告诉我哪些设备的关键指标在持续恶化。”“巡检完成后,用一句话总结整体健康度(正常/警告/严重),如果有严重问题,直接高亮并给出建议。” 摘选回复五:1.基于过去7天的运行数据,对核心网络设备做健康巡检,分析性能变化趋势,生成健康评估报告并预警潜在风险。2.对当前数据中心的数通设备(交换机、路由器、防火墙)做一次全面健康检查,生成包含设备状态、性能指标、潜在风险、优化建议的完整健康评估报告。 Q:【开放题】若是提供对话式交互的运维周报月报自动生成能力,您会如何下指令?列举出您可能的描述?摘选回复一:1.生成本周各业务系统的运维周报,包含告警统计、故障处置、在线率、隐患排查情况。2.生成本周辖区所有路口信号机及其通信链路的运行周报,包括故障频次、离线点位、及其他性能指标。3.生成本周辖区内所以摄像机、网络设备的运行情况周报,并标注高风险点位。 摘选回复二:1、对于AI 大模型的安全防护需要不单单是某几台设备,更多需要的全面整体安全防御方案,从安全的全生命周期建设从 数据预处理、训练、调优、大模型部署、模型微调蒸馏、优化、日常维护等全流程做好安全防护,并且对于安全攻击实践要做到提前预警、超前防御,真正做到无侵入式外置安全防护和侵入式安全内生防护相结合。2、对于无侵入式外置安全防护,借助基础安全硬件,聚焦AI 大模型基础环境资源,建设通用安全AI 防护平台,让AI 应用借助安全平台实现有针对性的安全能力的实现,实现包括入侵监测、拖库攻击、提示词攻击、模型非法调用、超额并发攻击、关联安全风险预警平台等等。对于侵入式的安全内生防护,则重点着眼于AI 应用本身,通过优化和量身定制安全策略,实现提示词控制、模型推理污染防御、token输出安全合规、优化AI 使用安全权限管理、敏感信息脱敏等角度实现对于AI 大模型的安全限制,真正不断优化企业AI 安全诉求。    摘选回复三:我回直接进行问答,比如:1、生成周报/月报:帮我生成上周的网络运维周报,要包含故障统计、资产变更情况、性能概览和安全事件,顺便生成一份上个月的运维月报,重点分析下网络中断的原因,并给出下个月的优化建议2、针对定制化的行业报告:帮我整理一份给领导汇报的材料,用通俗易懂的语言总结本月的网络运行情况,突出我们做的工作和取得的成效,生成一份面向业务部门的报告,告诉他们本月IT系统对他们的业务支撑情况,比如系统可用率、平均响应时间等。 摘选回复四:我会这样下指令:“帮我自动生成本周运维周报,要包含故障处理次数、主要故障类型及解决时长统计。”“生成上个月运维月报,重点呈现系统资源使用率变化趋势、重大故障详情及影响范围。”“以图文结合的形式,生成本周运维周报,突出显示网络设备的运行状态和异常情况。”“生成本月运维月报,要有对运维工作改进建议的部分,涵盖故障预防和效率提升方面。” Q:【开放题】您使用openClaw解决了哪些问题?您觉得openClaw还能如何为日常运维工作带来便利?摘选回复一:主要用来做医疗机房设备健康巡检、网络故障快速排查,自动筛查日志异常;同时辅助配置备份、变更前风险检查,减少人工排查失误,保障医院 HIS、电子病历、影像系统、检验系统等核心业务稳定运行。还能自动完成日常巡检、报表生成,减少重复工作,提前预判硬件、网络故障,规避医院业务中断风险一键生成医疗项目运维方案、变更方案,提升项目推进效率。 摘选回复二:目前主要使用openClaw辅助处理运维知识查询、配置命令参考、故障处理思路整理、巡检报告和运维文档编写等工作。它可以帮助快速定位常见问题、整理排障步骤、生成报告初稿,提升技术支持和客户响应效率。希望后续openClaw能进一步对接现网告警、工单、巡检和设备数据,实现自动分析告警根因、推荐处置方案、生成健康检查报告、辅助变更方案编写和应急预案生成,从而减少重复性工作,提高轨道交通行业运维的规范性和效率。    摘选回复三:解决了哪些问题:1、自动做服务器的巡检及报告输出(每天检查不同架构中服务器的CPU使用率、内存占用、磁盘空间、服务状态、系统日志)并自动总结生成巡检报告2、自动排障并输出排障结果,当某个设备接口速率传输超过日常阈值,或者在非工作时间段有异常流量长时间在接口传输,OpenClaw被设定为接收到预警信息后做初始的排查,并记录其排查日志,并将排查结果反馈至故障报告。 摘选回复四:在运维方面、目前使用OpenClaw主要解决了多厂商设备的配置备份和基础合规性检查问题,通过对应的编程脚本,对现网不同品牌交换机的批量登录、配置抓取和存档,大大节省了最原始的手工逐台备份,节省了运维的基础运维时间便利方面:希望它能像iMaster NCE一样,支持自然语言交互,我通过直接说帮我把所有接入交换机的端口描述改为标准格式,它就能自动生成并执行,而不是让我编写代码在执行。第二点:现在的输出全是日志文本,很难看懂。希望能直接生成可视化拓扑和健康报告,并且在发现问题时,能自动触发修复流程,而不是只给我发个报警邮件。第三点:希望它能结合AI大模型,理解配置之间的逻辑关系。比如在变更前,不仅做到能备份,还能了解相关规则会不会把业务流量也挡住了,实现真正的智能变更风险预测。 点此查看获奖名单