分享好友 资讯首页 频道列表

【KDD2024】大数据基础工程技术集群异常检测论文入选

2024-08-26 17:5655370
 近日,由阿里云计算平台大数据基础工程技术团队主导,与浙江大学合作的论文《Cluster-Wide Task Slowdown Detection in Cloud System》被数据挖掘领域顶会ACM SIGKDD2024接收,该论文从集群整体作业执行情况分布入手,旨在解决集群整体作业运行变慢的异常检测问题。论文创造性地提出了撇脂注意力机制和picky loss function解决集群整体作业分布复合周期性及训练集污染的问题,并使用基于神经网络最优运输模块,实现精准定向检测集群整体作业运行时间分布变慢的异常。论文从新的视角分析云计算平台集群健康状态,实现了基于神经网络的集群作业整体变慢异常定向检测,与SOTA异常检测算法相比平均提升F1 score 5.3%。

ACM SIGKDD(国际数据挖掘与知识发现大会,KDD) 会议始于 1989 年,是数据挖掘领域历史最悠久、规模最大的国际顶级学术会议,被CCF(中国计算机学会)列为A类会议,KDD也是首个引入大数据、数据科学、预测分析、众包等概念的会议。KDD2024将于8.25-8.29, 在西班牙巴塞罗那举行。此次入选意味着阿里云提出的集群级别作业变慢异常检测框架获得了国际学者的认可,也是一次产学研结合的成功实践。

针对大规模云计算平台集群作业运行变慢的异常检测问题,存在以下挑战:

(1)从个体作业入手监测集群是否存在显著变慢问题,会受到虚拟环境不确定性对个体执行速度的干扰,对个体进行检测、形成定性结论再集合到整体的方式无法准确反映整体作业执行状况。

(2)对每个作业进行监测,与对整体分布进行监测相比,需要花费更多计算存储资源。

(3)训练数据中并不能总是保证所有数据都是正常的,往往也会夹杂无标签的异常数据,这与无监督异常检测的假设相悖。

论文首次从集群整体作业执行情况分布入手,检测集群整体作业分布变慢的问题。创造性地提出了撇脂注意力机制和picky loss function解决集群整体作业分布复合周期性及训练集污染的问题。并使用基于神经网络最优运输模块,定向检测集群整体作业分布变慢的问题。论文从新的视角分析集群健康状态,实现了基于神经网络的集群作业整体变慢异常定向检测,与SOTA异常检测算法相比平均提升F1 score 5.3%。

目前对应算法已经在阿里云云原生大数据计算服务MaxCompute集群异常监控场景中进行灰度。可以有效地帮助运维人员对集群运行健康状况进行评估,提前发现可能的风险隐患。

论文信息

● 论文名字:Cluster-Wide Task Slowdown Detection in Cloud System

● 论文作者:Feiyi Chen, Yingying Zhang, Lunting Fan, Yuxuan Liang, Guansong Pang, Qingsong Wen, Shuiguang Deng

● 论文pdf链接:https://arxiv.org/abs/2408.04236

● 部分参考文献:

【1】Su Y, Zhao Y, Niu C, et al. Robust anomaly detection for multivariate time series through stochastic recurrent neural network[C]//Proceedings of the 25th ACM SIGKDD international conference on knowledge discovery & data mining. 2019: 2828-2837.

【2】Zhang C, Song D, Chen Y, et al. A deep neural network for unsupervised anomaly detection and diagnosis in multivariate time series data[C]//Proceedings of the AAAI conference on artificial intelligence. 2019, 33(01): 1409-1416.

【3】Xu J, Wu H, Wang J, et al. Anomaly transformer: Time series anomaly detection with association discrepancy[J]. arXiv preprint arXiv:2110.02642, 2021.

【4】Yang Y, Zhang C, Zhou T, et al. Dcdetector: Dual attention contrastive representation learning for time series anomaly detection[C]//Proceedings of the 29th ACM SIGKDD Conference on Knowledge Discovery and Data Mining. 2023: 3033-3045.

【5】Tuli S, Casale G, Jennings N R. Tranad: Deep transformer networks for anomaly detection in multivariate time series data[J]. arXiv preprint arXiv:2201.07284, 2022.

举报 0
收藏 0
打赏 0
钢铁巨头的"绿色账本":西门子这招让碳排放大户变减排先锋
原创 西门子Xcelerator中国河钢携手西门子如果想知道“一家企业的年用电量是多少”?拉张电费单即可一目了然,可若问“一家企业

0评论2025-08-205064

别让假客服钻空子!拨打热线请认准官方指定
遇到家电问题,很多人习惯找客服寻求帮助,但在这个过程中,一定要注意辨别真假,避免落入假冒客服的陷阱。8月14日,南京市民薛

0评论2025-08-185186

智汇和平 模创启航!天津天开和平园·模创社区开园仪式成功举办
8月13日,“智汇和平·模创启航”天开和平园·模创社区(以下简称:模创社区)开园仪式圆满举办,市相关领导出席活动并致辞。天

0评论2025-08-155347

智能门锁下半场:拼完功能拼售后,看奇兵到家如何破智能门锁下半场
解智能门锁售后痛点智能家居浪潮中,智能门锁已跃升为“刚需级”单品。然而,黑猫投诉平台数据显示,相关投诉已突破2700条,其中

0评论2025-08-156287

艾聆科技推出随身 AI 助理 Note Pro 升级版,十大升级重塑行业标杆
作为AI领域的新锐力量,艾聆科技基于其研发团队深厚的技术功底,在行业已有标杆产品的基础上,进一步打磨升级,推出其面向工作学习场景的随身AI助理 Note Pro升级版。

0评论2025-08-155691

中科慧远发布首款工业质检机器人CASIVIBOT
8月19日,国内领先的AOI(自动光学检测)专有设备制造商中科慧远将举行新品发布会,正式推出其首款工业具身质检机器人「CASIVIBOT」。

0评论2025-08-145409

酒业仓储“效率革命”来了!中力数智新仓打造酒业智能仓储新典范
当千年酒香遇上智能科技会发生什么神奇反应?中力数智携手石花酒业打造智能化酿造中心,以数智新仓【密集堆垛+前移式机器人】一举

0评论2025-08-125625

专为中国用户“量身定制”!爱普生发布LA-A系列新品机器人
8月8日,爱普生以“智在中国 劲擎共赢”为主题,在爱普生技术(深圳)有限公司(下称:爱普生深圳工厂)重磅发布首款专为中国市

0评论2025-08-115555

比利·简·金杯深圳总决赛今日20点盛大开票,郑洁担任赛事推广大使
创办于1963年的比利·简·金杯是世界上最顶级的国际女子网球团体赛事,被誉为“女子网球世界杯”。2025-2027年,比利·简·金杯

0评论2025-08-115516

VisionChina2026(上海)机器视觉展焕新登场,报名抢占黄金展位!
VisionChina2026(上海)机器视觉展将于2026年3月25-27日在上海新国际博览中心W4W5馆盛大启幕!从核心零部件到智能系统集成,从2

0评论2025-08-075802