成人免费xxxxx在线视频软件_久久精品久久久_亚洲国产精品久久久_天天色天天色_亚洲人成一区_欧美一级欧美三级在线观看

掌握Web應用的監控與告警

運維 網絡運維
監控最重要的是在故障發生時,能將告警信息發送出來,讓正確的人第一時間獲悉故障的詳情,只有這樣才能盡快排除故障。企業微信很多公司都有使用,而且Alertmanager支持將企業微信作為告警通道。

最近組里又來了一個需求:當告警發生時,將告警信息通過企業微信發送給開發的相關負責人,方便盡快排除故障。實際使用Alertmanager來完成這項工作,下面介紹具體的實現方法。

詳細配置

  • 告警通道配置

監控最重要的是在故障發生時,能將告警信息發送出來,讓正確的人第一時間獲悉故障的詳情,只有這樣才能盡快排除故障。企業微信很多公司都有使用,而且Alertmanager支持將企業微信作為告警通道。

按照企業微信的官方文檔來配置告警通道,如果覺得麻煩,可以在瀏覽器上搜索“alertmanager 企業微信”關鍵字,就有很多配置例子展示。我們需要得到下面五個鍵值對:

wechat_api_url: 'https://qyapi.weixin.qq.com/cgi-bin/'wechat_api_corp_id: '12345678'agent_id: 12345678api_secret: 12345678to_tag: 4

這五個鍵值對需要在Alertmanager中配置,后面四個鍵的值根據實際情況填寫。

企業微信有三種ID來選擇消息的接收對象:用戶ID、部門ID和標簽ID。因為第三種方式支持同時包含用戶和部門,使用起來比較靈活,這里選擇第三種方式。

標簽ID

點擊“標簽詳情”,可以看到標簽ID,在配置Alertmanager時會用到。

標簽ID顯示

  • Blackbox配置

這里直接將配置文件貼出。

docker-compose.yaml:

version: '3.3'services:  blackbox_exporter:    image: prom/blackbox-exporter:v0.19.0    ports:      - "9115:9115"    restart: always    volumes:      - "./config:/config"    command: "--config.file=/config/blackbox.yaml"

config/blackbox.yaml:

modules:  http_get:    prober: http    timeout: 5s    http:      valid_http_versions: ["HTTP/1.1", "HTTP/2.0"]      valid_status_codes: [200]      no_follow_redirects: false      tls_config:        insecure_skip_verify: true
  • Alertmanager配置

這里是關鍵,因為告警通知的發送控制都由Alertmanager來控制。配置文件如下。

docker-compose.yaml:

alertmanager:  image: bitnami/alertmanager:0  restart: "always"  ports:    - 9093:9093  container_name: "alertmanager"  volumes:      - "./config:/etc/alertmanager"

config/config.yml:

global:  resolve_timeout: 5m  wechat_api_url: 'https://qyapi.weixin.qq.com/cgi-bin/'  wechat_api_corp_id: '1234567'templates:  - '/etc/alertmanager/*.tmpl'route:  receiver: wechat  group_wait: 1s  group_interval: 1s  repeat_interval: 2s  group_by: [adm]  routes:    - matchers:          - adm="search"      receiver: searchEngine      group_wait: 10s    - matchers:          - adm="portalweb"      receiver: portalWeb      group_wait: 10sreceivers:- name: wechat  wechat_configs:  - to_tag: infra    message: '{{ template "wechat.message" . }}'    agent_id: 1000002    message_type: markdown    api_secret: verylongstring- name: searchEngine  wechat_configs:  - to_tag: searchdep    message: '{{ template "wechat.message" . }}'    agent_id: 1000002    message_type: markdown    api_secret: verylongstring- name: portalWeb  wechat_configs:  - to_tag: portalwebdep    message: '{{ template "wechat.message" . }}'    agent_id: 1000002    message_type: markdown    api_secret: verylongstring

有幾個參數需要介紹下:

group_wait:Alertmanager 在接收到一條新的告警(第一次出現的告警)時,將這條告警發送給 receiver 之前需要等待的時間。

group_interval:對于一條已經出現過的告警,alertmanager 每隔 group_interval 時間檢查一次告警。

repeat_interval: 對于一條已經出現過的告警,每隔 repeat_interval 會重新發送給 receiver。

有篇文檔整理得很好,這里直接列出來。

“Alertmanager 在收到一條新的告警之后,會等待 group_wait 時間,對這條新的告警做一些分組、更新、靜默的操作。當第一條告警經過 group_wait 時間之后,Alertmanager 會每隔 group_interval 時間檢查一次這條告警,判斷是否需要對這條告警進行一些操作,當 Alertmanager 經過 n 次 group_interval 的檢查后,n*group_interval 恰好大于 repeat_interval 的時候,Alertmanager 才會將這條告警再次發送給對應的 receiver。”

文中這三個參數配置的值很小,主要為測試目的,生產環境根據需要配置。

還有一點需要注意,Alertmanager子路由(即routes里面)中配置的參數會覆蓋根路由(即route里面)中配置的參數,所以按照文件“config/config.yml”中的配置,如果一條告警發送到了“searchEngine”,就不可能再發送給默認的接收者“wechat”,除非子路由沒有匹配。

告警模板文件:config/wechat.tmpl。

{{ define "wechat.message" }}{{- if gt (len .Alerts.Firing) 0 -}}{{- range $index, $alert := .Alerts -}}{{- if eq $index 0 -}}# 報警項: {{ $alert.Labels.alertname }}{{- end }}> `**===告警詳情===**` > 告警級別: {{ $alert.Labels.severity }}> 告警詳情: <font color="comment">{{ index $alert.Annotations "description" }}{{ $alert.Annotations.message }}</font>> 故障時間: <font color="warning">{{ ($alert.StartsAt.Add 28800e9).Format "2006-01-02 15:04:05" }}</font>> 故障實例: <font color="info">{{ $alert.Labels.instance }}</font>{{- end }}{{- end }}{{- if gt (len .Alerts.Resolved) 0 -}}{{- range $index, $alert := .Alerts -}}{{- if eq $index 0 -}}# 恢復項: {{ $alert.Labels.alertname }}{{- end }}> `===恢復詳情===` > 告警級別: {{ $alert.Labels.severity }}> 告警詳情: <font color="comment">{{ index $alert.Annotations "description" }}{{ $alert.Annotations.message }}</font>> 故障時間: <font color="warning">{{ ($alert.StartsAt.Add 28800e9).Format "2006-01-02 15:04:05" }}</font>> 恢復時間: <font color="warning">{{ ($alert.EndsAt.Add 28800e9).Format "2006-01-02 15:04:05" }}</font>> 故障實例: <font color="info">{{ $alert.Labels.instance }}</font>{{- end }}{{- end }}{{- end }}

其中語句“{{ ($alert.StartsAt.Add 28800e9).Format "2006-01-02 15:04:05" }}”是將時間轉換成北京時間,否則默認顯示的是UTC時間,不利于故障發生時間的查看。

配置完Alertmanager,再看Prometheus的配置。

  • Prometheus配置

Prometheus需要增加告警規則文件,所有待監控的metrics都保存在Prometheus中,但它并不知道metrics的值處于什么狀態的情況下,自己要發告警給Alertmanager,所以要通過增加告警規則文件告知Prometheus,各個配置文件如下,

docker-compose.yaml:

version: '3.3'services:  prometheus:    image: prom/prometheus    restart: always    ports:      - "9090:9090"    volumes:      - "./config:/config"    command: --config.file=/config/prometheus.yaml

Prometheus的配置文件,config/prometheus.yaml:

# my global configglobal:  scrape_interval: 15s # Set the scrape interval to every 15 seconds. Default is every 1 minute.  evaluation_interval: 15s # Evaluate rules every 15 seconds. The default is every 1 minute.  # scrape_timeout is set to the global default (10s).# Alertmanager configurationalerting:  alertmanagers:    - static_configs:        - targets:          - 192.168.52.128:9093# Load rules once and periodically evaluate them according to the global 'evaluation_interval'.rule_files:   - /config/alerts.rules # A scrape configuration containing exactly one endpoint to scrape:# Here it's Prometheus itself.scrape_configs:  - job_name: 'web-monitor'    scrape_interval: 1m    metrics_path: /probe    params:      module: [http_get]    static_configs:      - targets:        - https://www.baidu.com        - https://cn.bing.com        labels:          adm: "search"      - targets:        - https://www.163.com        - https://www.ifeng.com        labels:          adm: "portalweb"    relabel_configs:      - source_labels: [__address__]        target_label: __param_target      - source_labels: [__param_target]        target_label: instance      - target_label: __address__        replacement: 192.168.52.128:9115  # The blackbox exporter's real hostname:port.

Prometheus的告警規則文件,config/alerts.rules:

groups:    - name: Web監控      rules:      - alert: Web API不能訪問        expr: probe_success == 0        for: 10s        labels:          severity: 非常嚴重        annotations:          summary: "{{$labels.instance}}:鏈接不能訪問"          description: "{{$labels.instance}}:鏈接超過10s無法連接"

到這里,所有的配置已經完成,看下效果:

效果展示

在Prometheus上查看probe_success metric的值,看到此時鏈接“https://www.163.com”訪問異常(當然不是真的有問題,可以使用一些手段模擬)。

prometheus查看

查看Alertmanager Web界面,也收到了Prometheus發送過來的告警信息。

Alertmanager告警詳情

企業微信告警信息如下。

企業微信告警

總結

依賴企業微信和Alertmanager便實現根據告警詳情指定告警接收人的配置。

責任編輯:姜華 來源: 今日頭條
相關推薦

2023-10-26 08:35:53

2011-03-25 11:06:46

2010-11-24 11:32:46

2010-07-29 14:27:52

FlexWeb

2021-09-27 19:41:31

監控Sentry Alerts

2013-08-28 17:35:35

監控故障告警雅虎

2019-01-17 08:38:03

Redis監控內存

2023-04-20 07:12:33

夜鶯監控夜鶯

2011-03-25 11:18:51

2023-09-11 13:33:10

2012-01-13 13:51:21

云計算

2012-01-12 09:30:26

虛擬化云計算Web應用

2009-12-15 10:19:05

Linux應用程序

2011-02-21 09:10:42

WebHTML 5JavaScript

2024-08-13 08:22:04

緩存機制C#內存緩存工具

2009-07-02 09:50:19

.NET監控技術

2018-12-04 09:02:36

Web服務器PHP

2015-05-12 15:02:23

API應用性能監控云智慧

2024-04-09 08:00:00

Kubernetes管理系統云原生

2021-05-10 09:00:00

Web工具安全
點贊
收藏

51CTO技術棧公眾號

主站蜘蛛池模板: 无码日韩精品一区二区免费 | 免费超碰 | 日本中文字幕在线视频 | 亚洲在线| 亚洲第一成人影院 | 欧美日韩一区在线观看 | 日本成人片在线观看 | 亚洲精品不卡 | 中国免费黄色片 | av在线免费观看网站 | 日韩av一区二区在线观看 | 国产精品a久久久久 | 国产日产久久高清欧美一区 | 欧美日韩精选 | 国产精品久久久久久久久免费软件 | 日本网站在线看 | 国产精品日产欧美久久久久 | 欧美一级视频在线观看 | av黄色在线| 国产欧美一区二区三区日本久久久 | 国内精品久久精品 | 99re热这里只有精品视频 | 精品久久久久久红码专区 | 91精品国产综合久久婷婷香蕉 | 国产乱码精品1区2区3区 | 精品91av| 欧美精品久久 | 日日操视频 | 欧美日韩视频在线播放 | 免费精品视频在线观看 | 中文字幕99| 精品一区在线看 | 在线视频中文字幕 | 免费在线一区二区 | 久久久精| 成人精品一区二区三区 | 自拍偷拍亚洲一区 | 欧美日韩电影在线 | 久久高清精品 | 岛国av一区二区 | 国产精品久久久久一区二区三区 |