文档目录

V5.1

项内容
版本5.1
发布日期2026-04-10

核心监控告警功能完善

1. 重新梳理带外告警采集、过滤、屏蔽、展示规则

背景说明

DCMP 带外告警采集存在多采问题,且不同厂商带外告警及日志接口特性差异大,需要重新梳理采集和过滤逻辑。原先告警屏蔽仅支持单一规则,无法精确到设备级,复杂场景难以满足管控需求。

功能介绍

路径:监控 → 监控设置 → 告警设置 → 告警屏蔽规则。

支持创建多条屏蔽规则、设置多个屏蔽条件;同一设备命中任一规则即被屏蔽。

告警屏蔽规则列表

新增告警屏蔽规则

2. 增加 AI 告警分析

背景说明

系统已能采集并通知告警,但运维仍需凭经验查阅资料或联系原厂才能处理,耗时长。需要结合厂商技术文档、近期日志、操作记录、能耗数据等,判断原因、评估影响并给出处理建议。

功能介绍

路径:监控 → 告警管理 → 当前告警。

对某条告警点击「AI 分析」,系统调用 AI Agent:查询知识库中的官网告警信息,结合该告警前 50 条 BMC 日志、DCMP 操作日志以及温度功耗数据,输出分析报告。报告先给出概览(是否误报、影响范围、处理建议),需要时再看详细分析。

当前告警中的 AI 分析

AI 告警分析报告

3. 新华三交换机采集 ARP 表、接口表、路由表

背景说明

除健康状态外,用户还需要 ARP 表、接口表、路由表等运行配置,用于拓扑分析、故障排查和流量管理。

功能介绍

路径:监控 → 设备监测 → 监测详情。对监控中的新华三交换机,可定期采集接口表、路由表、ARP 表。

设备管理功能完善

4. 设备统计增加「固件统计」

背景说明

固件版本管理是设备管理的重要环节。了解各厂商 BMC(管理版本)和 BIOS 版本分布,有助于升级规划、兼容性检查和漏洞修复。

功能介绍

路径:设备 → 设备统计 → 固件统计。从 BMC 版本和 BIOS 版本两个维度,统计不同厂商下各版本对应的服务器数量,便于明确升级范围和清单。

固件统计

5. 数据中心管理概览增加部件管理统计

背景说明

除设备整体情况外,还需要 CPU、内存、硬盘、网卡等部件的厂商 / 型号 / 容量分布,用于信创率判断、备件采购、老化分析和性能瓶颈识别。

功能介绍

路径:机房 → 管理概览更多。可从全部数据中心、某一数据中心或某一机房查看不同部件统计,点击数据可下钻到部件列表并导出。

部件管理统计

部件列表下钻

管理概览部件维度

部件统计明细

6. 发现设备时自动识别「是否信创」

信创转型中,准确统计信创设备占比是基础。原先需手动设置型号的「是否信创」,工作量大且易错。现于设备发现时根据 CPU 厂商自动识别并赋值,提高信创率统计的准确性和效率。

7. 机柜可视化支持自定义上架设备展示字段

背景说明

不同用户查看机柜时关注点不同(健康状态、业务信息、告警等)。提供自定义展示字段,可按需求灵活配置。

功能介绍

路径:机房 → 进入某个机房 → 打开某个机柜。点击「列设置」可调整展示字段及顺序,并可选择生效范围:当前机柜、全部机柜或指定部分机柜。每个用户可配置自己关注的字段和顺序。

机柜可视化列设置

列设置生效范围

自定义字段后的机柜视图

技术架构优化

8. 周期任务可按设备类型或标签设置执行频率

背景说明

不同类型或重要程度不同的设备,对监控实时性要求不同。可按类型或标签设置执行频率,在保证效果的同时优化资源占用。

功能介绍

路径:监控 → 监控设置 → 周期任务执行频率配置。当前周期任务主要是基础健康和能耗采集。生产、重要业务设备可调高频率;次要 / 测试设备或性能差的老旧设备可调低,降低对设备影响并减少系统消耗。

周期任务执行频率配置

9. 优化设备二次发现逻辑

针对首次发现和二次发现中的问题进行梳理优化,保障发现准确性与信息正确性。

设备发现逻辑优化

二次发现结果

10. hKVM 支持清华同方(鲲鹏)、浪潮(海光)

随着信创设备普及,hKVM 作为远程管理工具,需要支持鲲鹏、海光等国产芯片服务器。

11. 告警、带外日志、平台日志可通过 Kafka 对接统一监控平台

满足告警和日志对接需求,DCMP 将告警和日志通过 Kafka 协议吐给监控平台(如 iTOP)。

12. 持续优化技术架构与产品性能

持续优化代码逻辑、数据库查询、接口调用等,提升流畅度、稳定性与扩展性。