跳到主要内容
版本:4.x

监控告警常见问题

Q1:如何 开启/关闭 监控告警服务?

找到服务配置页面,先点击开启/关闭监控告警服务按钮,点击 保存并重启

这张图片展示的是Enterprise Manager的配置服务页面,页面左侧导航栏选中了“组件配置”选项,在该页面的“监控告警服务”区域,“开启”选项被红色框线标出,对应前文提到的开启监控告警服务的操作要求。页面左下角的导航菜单中,“服务配置”选项也被红色框线标注,最底部的“保存并重启”按钮同样带有红色框线,呼应上下文里修改配置后需点击该按钮完成操作的说明,整体是监控告警服务配置的相关界面。

Q2:如何开启或关闭监控告警的认证功能?

注意:

  • Manager 24.0.3 版本开始,默认为监控组件开启认证功能
  1. 找到认证的开关

    编辑 webserver/conf/manager.conf 文件

    • 设置MONITOR_AUTH_ENABLE字段为 FALSE 则关闭监控的认证(修改完需重启 webserver )
    • 设置MONITOR_AUTH_ENABLE字段为 TRUE 则开启监控的认证(修改完需重启 webserver )
  2. 设置账号密码(如果您打算开启监控的认证)】

    增加监控组件的认证,也就是赋予grafana、prometheus、alertmanager 三个组件单独的账号和密码

    • 开启认证开关

      • 设置 MONITOR_AUTH_ENABLE = TRUE
    • 设置 grafana 的账号和密码

      • GRAFANA_USER字段代表 grafana 组件的用户名(目前只支持 admin 用户)
      • GRAFANA_PASS字段代表 grafana 组件的密码,不单独设置的话 manager 在启动时会为其设置随机密码,并存储在config_tool_configs表里面的grafana_pass字段中
    • 设置 prometheus 的账号和密码

      • PROMETHEUS_USER字段代表 prometheus 组件的用户名(通常使用 admin 用户)
      • PROMETHEUS_PASS字段代表 prometheus 组件的密码,不单独设置的话 manager 在启动时会为其设置随机密码,并存储在config_tool_configs表里面的prometheus_pass字段中
    • 设置 alertmanager 的账号和密码

      • ALERTMANAGER_USER字段代表 alertmanager 组件的用户名(通常使用 admin 用户)
      • ALERTMANAGER_PASS字段代表 alertmanager 组件的密码,不单独设置的话 manager 在启动时会为其设置随机密码,并存储在config_tool_configs表里面的alertmanger_pass字段中

    示例:

    # whether to add auth for monitor components or not
    MONITOR_AUTH_ENABLE=TRUE

    # grafana user(only support admin)
    GRAFANA_USER=admin
    # if {MONITOR_AUTH_ENABLE} is true and password is empty, use random password
    GRAFANA_PASS=

    # prometheus user
    PROMETHEUS_USER=admin
    # if {MONITOR_AUTH_ENABLE} is true and password is empty, use random password
    PROMETHEUS_PASS=

    # alertmanager user
    ALERTMANAGER_USER=admin
    # if {MONITOR_AUTH_ENABLE} is true and password is empty, use random password
    ALERTMANAGER_PASS=

Q3:如何查看监控告警组件的密码?

  1. 查看 webserver/config-tool/meta/meta.yaml文件

    grafana:
    auth_user: admin
    auth_pass: xxxxx
    prometheus:
    auth_user: admin
    storage_retention_time: 30
    auth_pass: xxxxx
    alert_manager:
    auth_user: admin
    auth_pass: xxxxx
  2. 如果没有出现 webserver/config-tool/meta/meta.yaml 文件,需要登录数据库查看

    • 登录数据库

      Manager 查看/修改元数据的操作步骤

    • 查看密码

      登录到mysql 或者 H2 之后,可以直接执行 SELECT * FROM CONFIG_TOOL_CONFIGS 查看 config_tool_configs这个表,找到下图的几个字段即可

      图片展示的是在mysql或H2数据库中执行SELECT * FROM CONFIG_TOOL_CONFIGS查询后,显示的config_tool_configs表部分内容。其中,grafana_auth_enable字段值为false,grafana_pass字段值为true,prometheus_auth_enable字段值为false,prometheus_user字段值为true,alertmanager_auth_enable字段值为false,alertmanager_user字段值为true。这些字段与创建告警策略失败问题处理相关,可帮助排查配置问题。

Q4:创建告警策略失败如何处理?

创建告警策略如果失败,需要检查是否是编码问题导致,目前需要mysql支持utf8编码。

  1. 查看数据库编码:

    mysql> show variables like 'character%';
    +--------------------------+----------------------------+
    | Variable_name | Value |
    +--------------------------+----------------------------+
    | character_set_client | utf8 |
    | character_set_connection | utf8 |
    | character_set_database | utf8 |
    | character_set_filesystem | binary |
    | character_set_results | utf8 |
    | character_set_server | utf8 |
    | character_set_system | utf8 |
    | character_sets_dir | /usr/share/mysql/charsets/ |
    +--------------------------+----------------------------+
    8 rows in set (0.05 sec)
  2. 如果不能立即重启mysql永久修改编码,可以临时修改(连接mysql,直接执行下面的set语句)

    set character_set_database=utf8;
    set character_set_server=utf8;
  3. 在修改完mysql支持的编码为utf8之后,还需要对已有的表修改编码(所有的表都应改动)

    ALTER TABLE monitor_rules CONVERT TO CHARACTER SET utf8 COLLATE utf8_unicode_ci;
    ALTER TABLE monitor_annotations CONVERT TO CHARACTER SET utf8 COLLATE utf8_unicode_ci;
    ALTER TABLE alert_records CONVERT TO CHARACTER SET utf8 COLLATE utf8_unicode_ci;
    ALTER TABLE message_center CONVERT TO CHARACTER SET utf8 COLLATE utf8_unicode_ci;
    ALTER TABLE timed_inspections CONVERT TO CHARACTER SET utf8 COLLATE utf8_unicode_ci;
    ALTER TABLE cluster_inspections CONVERT TO CHARACTER SET utf8 COLLATE utf8_unicode_ci;
    ALTER TABLE job_stages CONVERT TO CHARACTER SET utf8 COLLATE utf8_unicode_ci;
  4. 修改完之后需要重启webserver

    cd webserver;
    # 停止 webserver
    sh bin/stop.sh
    # 启动 webserver
    sh bin/start.sh

Q5:如何管理监控数据的存储目录以及保留时长?

目前监控数据的默认存储路径为{Prometheus部署目录}/dataPrometheus部署目录在manager部署目录下面的deps/prometheus),数据保留时间为30天,如果当前服务配置里面的高级配置为空,可以补充上面两个输入

图片展示了Doris Manager监控告警服务的配置界面。其中,关键信息是“监控数据存储目录”和“监控数据保留时长”。监控数据存储目录为“/home/testcloud/doris - manager/deps/prometheus/data”,监控数据保留时长为30天。该图片与文档中“如何管理监控数据的存储目录以及保留时长?”的问题对应,直观呈现了当前服务配置中高级配置下的相关设置。

Q6:监控看板无数据如何排查?

  1. 如果是所有看板都无数据,需要确认以下几个方面:

    1. Manager 服务所在的机器与浏览器所在机器的时区和时间是否一致

    2. Prometheus 服务是否正常,可以到服务配置里面查看一下状态,如果服务停止,可点击“启动”来开启服务

      图片展示的是SelectDB Enterprise Manager的配置界面,左侧有导航栏,选中“服务”。右侧显示了Grafana、Prometheus、Alertmanager等服务状态,其中Prometheus服务右侧有“启动”按钮被红色框突出显示。界面左下角有“admin”选项被红色框突出显示。该图片与文档中“如果是所有看板都无数据,需确认Prometheus服务是否正常,可到服务配置里面查看状态,如果服务停止,可点击‘启动’来开启服务”内容相关,直观呈现了Prometheus服务状态及启动按钮位置。

  2. 如果是部分看板无数据,可能是部分采集节点挂掉或者网络超时,需要登录 Prometheus 页面查看具体原因如下图就出现了一个报错的节点,需要确认对应进程(Agent、FE、BE)是否存活且网络通畅

    1. 根据服务配置里面设置的端口(如下图的 9095),您需要在浏览器里面访问 promehteus 页面(目前监控组件默认都是开启认证的,查看密码的步骤请看 Q3 )

      图片展示了SelectDB Enterprise Manager中配置监控告警服务的界面。在“端口配置”区域,Grafana端口为3005,Prometheus端口为9095,Alertmanager端口为9097。该图片与文档中“Q7:配置‘钉钉’告警对象未收到告警消息怎么处理?”问题相关,用于说明在配置监控告警服务时,需关注各组件端口的设置,此处以Prometheus端口为例,帮助用户了解其在配置中的位置及默认值,以便排查未收到告警消息的原因。

    2. 进入 Prometheus Web 页面,检查 targets 页面有无节点数据以及报错(其中 targets 就是监控数据的来源节点)

      图片展示了Prometheus Web页面中“Status”下拉菜单的界面。菜单中包含多个选项,其中“Targets”选项被红色框突出显示。该图片与文档中“部分看板无数据”问题的排查步骤相关,用于说明在浏览器访问promehteus页面后,进入Prometheus Web页面,需检查targets页面有无节点数据以及报错,此图即为进入Prometheus Web页面后可查看targets页面的示例,帮助排查部分看板无数据的原因。

      图片展示的是Prometheus Web页面中Targets页面。页面显示了多个监控数据来源节点,其中“cluster-64917278073861”节点的“State”状态为“DOWN”,“Last Scrape”时间为7.546秒前,“Scrape Duration”为11.934秒,且“Error”栏显示“Get “http://172.20.17.107:8972/metrics”:dial tcp 172.20.17.107:8972: connect: connection refused”。该图片与文档中“部分看板无数据可能是部分采集节点挂掉或网络超时,需登录Prometheus页面查看具体原因”的内容相关,用于说明检查targets页面有无节点数据及报错时可能出现的情况。

Q7:配置"钉钉"告警对象未收到告警消息怎么处理?

  1. 在告警历史页面确认是否产生了告警

  2. 检查钉钉机器人的配置

    • 检查IP白名单是否配置

    • 关键字过滤部分需要增加 "Alert" 和 "告警" 字样

      图片展示的是SelectDB Enterprise Manager中添加机器人的界面。界面中“机器人名字”为“告警机器人”,“添加到群组”为“报警群”。“安全设置”部分,自定义关键词已勾选,输入框内有“Alert”和“告警”字样。下方有“加签”和“IP地址(段)”选项,均未勾选。最下方有“我已阅读并同意《自定义机器人服务及免责条款》”的勾选框,以及“取消”和“完成”按钮。该图片与文档中检查钉钉机器人配置的内容相关,用于说明添加机器人的操作步骤。

  3. 其他问题,可查看 webserver/log/manager.out, 搜索 send DingTalk,找到具体报错

Q8:24.2.x 版本中如何在 grafana 自定义看板中增加/调整图表?

从 24.2.0 版本开始,Manager 分别对存算一体和存算分离集群提供2种类型的监控图表,如下图

图片展示了SelectDB Enterprise Manager 24.2.x版本中,从24.2.0版本开始对存算一体和存算分离集群提供的2种类型的监控图表。画面中“Doris Dashboard Overview”下拉菜单被红色框突出显示,其下有“Default Custom Doris Dashboard Overview”和“Doris Dashboard Overview”选项。该图片与文档中“Q8:24.2.x版本中如何在grafana自定义看板中增加/调整图表?”的问题相关,用于说明监控图表的类型及展示方式。

其中 Default Custom 开头的是默认的可编辑的图表,您可以在这个图表上面新增或者编辑自己的图表,在后续的 Manager 升级过程中,并不会覆盖该图表;而另外的 Doris Dashboard Overview 则是不可编辑的,后续的 Manager 升级过程会直接覆盖该图表

  1. 编辑当前图表

    图片展示的是SelectDB Enterprise Manager监控页面中“Default Custom Doris Dashboard Overview”看板的界面。画面中有一个红色框突出显示的“Edit”选项,其右侧有数字序号“1”标识。该图片与文档中“编辑当前图表”部分内容相关,用于说明在监控页面中,可对“Default Custom Doris Dashboard Overview”等可编辑的自定义看板进行编辑操作,如修改图表名称、PromQL等,此图直观呈现了编辑操作的入口位置。

    可以修改图表名称,图表对应的 PromQL 等

  2. 新增图表

    目前 Manager 对监控页面的编辑方式并未完全放开,新增图表可以直接登录 grafana 修改,登录方式

    • 找到 grafana 的服务端口

      这张图片展示的是SelectDB Enterprise Manager的配置服务页面,页面左上角的用户菜单已展开,红框标注出“服务配置”选项。页面核心的端口配置区域中,红框突出显示了“Grafana端口”对应的数值3000,另有Prometheus端口、Alertmanager端口的配置项。该页面内容对应文档中提到的查找grafana服务端口的操作步骤,直观呈现了配置服务时的相关界面,帮助用户定位grafana服务端口的具体数值。

    • 访问 Grafana 页面,用户名为 admin,密码可以根据 Q3 查找

      图片展示的是Grafana登录页面。页面顶部有Grafana的标志,下方是“Welcome to Grafana”的欢迎语。页面中有两个输入框,上方输入框提示“Email or username”,已输入“admin”;下方输入框提示“Password”,已输入“password”。页面底部有一个蓝色的“Log in”登录按钮,以及“Forgot your password?”的找回密码链接。该图片与文档中“新增图表”部分上下文相关,说明了登录Grafana页面的用户名和密码信息。

    • 找到要编辑的看板

      图片展示了Grafana的左侧导航栏界面。导航栏中“Dashboards”选项被红色框线突出显示。该图片与文档中“新增图表”部分内容相关,用于说明在Grafana中找到要编辑的看板的操作步骤,即在左侧导航栏点击“Dashboards”进入看板页面,后续可在此页面通过Add方式新增看板或通过复制已有看板进行编辑。

      图片展示的是SelectDB Enterprise Manager监控页面中Grafana的Dashboard界面。界面左侧有“Dashboards”“Playlists”“Snapshots”“Library panels”等选项。右侧显示“Dashboards”下的内容,有“General”“Doris Cloud”“Doris”等分类,其中“General”分类下有“Default Custom Doris Cloud Dashboard Overview”“Default Custom Doris Dashboard Overview”等看板,这些看板名称前有可勾选的方框。该图与上下文介绍的编辑图表、新增图表等内容相关,直观呈现了可编辑的自定义看板。

      点击 General 目录,可以看到 4 个内置的看板,Default Custom开头的为可编辑的自定义看板,其中Default Custom Doris Dashboard Overview为存算一体集群的自定义看板,Default Custom Doris Cloud Dashboard Overview为存算分离集群的自定义看板

    • 通过 Add 方式新增看板

      图片展示的是Grafana监控页面。页面上方有“Add”按钮,点击后弹出下拉菜单,其中“Visualization”选项被红色框突出显示。页面下方有多个图表,包括QPS、99th Latency、Load Rows Rj等数据的折线图和柱状图。页面左下角有多个监控面板标题,如“[Example] Custom Cluster Overview Monitor”等。该图片与文档中“通过Add方式新增看板”的内容相关,直观呈现了在Grafana中通过“Add”按钮添加可视化图表的操作位置。

    • 通过复制已有看板进行编辑

      图片展示的是SelectDB Enterprise Manager监控页面中“[Example] Custom Cluster Overview Monitor”看板的界面。画面右侧有一个下拉菜单,其中“More...”选项被红色框突出显示。该图片与文档中“通过复制已有看板进行编辑”部分内容相关,用于说明在已有看板基础上进行编辑的操作步骤,即通过点击看板右上角的下拉菜单,选择“More...”中的“Copy”选项,可复制已有看板进行编辑。

    具体可以参考开源的方式