跳到主要内容

最佳实践:引擎健康分运营

OpenInsight 可以用 cluster score 对计算引擎做日常健康巡检:默认评估昨天全天,从耗时 ≥5 分钟的执行历史中识别失败、内存超限、慢查、大扫描、重复热点等风险并扣分,输出 0–100 的健康分与扣分明细。

适合值班早会、容量复盘,或先回答「引擎昨天健康吗、主要扣在哪」,再下钻到 引擎执行记录分析 与 SQL 性能优化。

场景​

平台 / 数仓值班需要快速判断魔方计算引擎是否健康,以及昨天主要风险集中在哪一类问题,而不是先翻完整审计日志。

问题​

这个引擎的健康分是多少,哪些地方在扣分?

回答示例​

引擎健康分与扣分明细

Agent 默认查昨天(可显式指定时间窗口),调用:

# 默认:昨天 00:00:00 ~ 23:59:59
openinsight cluster score

# 指定窗口
openinsight cluster score \
--start-time '2026-08-04 00:00' \
--end-time '2026-08-04 23:59'

回答通常包含:

  1. 总分:如 0/100(扣分合计超过 100 时按 0 分封底)。
  2. 扣分表:超长耗时、执行失败、较长耗时、超大扫描、内存超限、查询取消、重复/并发热点等。
  3. 样本说明:评分基于当天耗时 ≥5 分钟的查询;同一查询可命中多项风险。

拿到扣分主因后,可继续用 cluster history --order-by query-time:desc 拉热点清单,再对 P0 任务走 taskrun diagnose。