★ 張萍(國網江蘇省電力有限公司泰興市供電分公司,江蘇 泰興 225400 )
關鍵詞:兩步Pair-Copula;供電計量數據;異常值;主動辨識;核密度估計;邊緣分布;條件概率函數;置信區間
供電計量數據是用電特征提取、用電趨勢分析以及電能管理規劃的重要依據,精準辨識計量數據中的異常值是開展精細化用電管理的關鍵。眾多學者圍繞電能計量數據異常識別方向開展了大量研究工作。其中,黃公躍等人提出了一種基于數據挖掘和機器學習的方法[1]。該方法通過分析電能計量數據的特征,構建了異常識別模型,能夠有效檢測數據中的異常點。實驗結果表明,該方法在異常識別的準確率和計算效率方面表現優異,為電能計量數據的質量管理提供了技術支持。但是在動態非參數變量場景下,該方法異常點識別的準確性較低;賈旭超等人提出了一種基于孤立森林(Isolation Forest)算法的電能計量數據異常檢測方法[2]。該方法通過孤立森林算法對電能計量數據進行建模,能夠快速識別數據中的異常點。實驗結果表明,該方法在異常檢測的準確率和計算效率方面具有顯著優勢,適用于大規模電能計量數據的實時監測。但其異常點識別的準確性高度依賴原始數據的質量;金晨提出了一種基于深度神經網絡(Deep Neural Network, DNN)的電能計量異常篩選方法[3]。該方法通過構建DNN模型, 對電能計量數據進行訓練和預測, 能夠有效識別數據中的異常點。實驗結果表明,該方法在異常篩選的準確率和魯棒性方面表現優異,為電能計量數據的智能化管理提供了新的解決方案。但當DNN的訓練樣本無法覆蓋所有異常狀態時,模型對異常點識別的準確性較低。
在上述基礎上,本文開展了基于兩步Pair-Copula的供電計量數據異常值主動辨識方法的研究,并在數據集上對該方法的異常辨識性能進行了具體的分析。
1 供電計量數據異常值主動辨識方法設計
1.1 非參數變量Pair-Copula邊緣分布計算
供電計量數據與客觀變量狀態密切相關,直接依據計量數據值的分布對異常值進行辨識時,往往存在較大誤差。針對此,本文基于Pair-Copula對供電計量數據異常值進行主動辨識時,引入了關聯供電計量數據值的非參數變量,對其邊緣分布進行計算。
供電計量數據的非參數變量具有連續屬性,導致其分布類型不明確。針對此,本文采用非參數核密度估計法開展基于供電計量數據本身的概率密度估計,得到對應的邊緣分布,以此避免分布類型假設錯誤引起的非參數變量邊緣分布計算誤差。其中,供電計量數據非參數變量的核密度估計表達式如式(1)、式(2)、式(3)所示:

其中,K(x)表示供電計量數據的非參數隨機變量x的高斯核函數; g(x)表示時序函數,利用其確保非參數隨機變量在同一時間維度;f(x)表示供電計量數據的非參數隨機變量x的邊緣分布估計結果;N表示供電計量數據非參數隨機變量的總體規模; xn表示供電計量數據非參數隨機變量的具體參數; 表示供電計量數據非參數隨機變量的分布區間范圍。
按照上述所示的方式,確定非參數變量的Pair- Copula邊緣分布,并將其作為后續異常值辨識的判定基礎。
1.2 供電計量數據Pair-Copula置信分布判定
根據關聯供電計量數據值的非參數變量邊緣分布情況,本文在對供電計量數據異常值進行辨識時,利用Pair-Copula確定供電計量數據的置信分布,將超出置信區間上下邊界的數值判定為異常值。
結合非參數變量Pair-Copula邊緣分布,電計量數據在置信區間的分布概率可表示為式(4)、式(5):

其中,F(y)表示電計量數據y的置信區間; H(*)表示條件概率函數; β和down分別表示電計量數據高于置信區間F(y)上限和低于置信區間F(y)下限的概率;K表示置信區間F(y)的不對稱系數; a表示電計量數據的置信概率。
結合式(5)的計算結果,將超出置信區間范圍的電計量數據判定為異常值,以此保障異常辨識結果的準確性。
2 算例分析
2.1 測試數據
本次測試數據來源于某實際運行的電力計量系統。該系統中包含每個用戶在每個特定時間間隔內的電力消耗情況,具體涵蓋每日數據。為確保數據質量,首先對原始的供電計量數據記錄進行過濾,根據實際需求設定數據對應的時間范圍為24h,并將其中100位用戶作為具體的篩選對象,最終輸出的測試數據集共包含684條供電計量數據,對應數據采樣頻率為30.0min/次。具體的測試數據信息如表1所示。
表1 測試數據信息

將過濾后的測試數據集保存為Excel文檔,作為異常值辨識分析的數據基礎。
2.2 測試結果
本實驗在對本文設計的供電計量數據異常值辨識方法的性能進行分析時,選取基于孤立森林,以及基于DNN的電能計量異常篩選方法作為對照組。
首先,對三種不同方法的異常值漏檢數量進行對比分析,結果如圖1所示。

圖1 異常值未識別或檢出數量對比圖
由圖1所示的測試結果可知,本文設計方法對測試數據不同時序下的異常值未識別數量始終低于3.0, 表明其具有有效的辨識性能。該方法利用數據與置信區間之間的分布關系對異常值進行判斷,大大降低了以定值參數為基準進行判定引起的偏差,顯著提高了異常辨識準確度。
其次,對三種不同方法的異常值誤檢數量進行對比分析,結果如圖2所示。
由圖2所示的測試結果可知,本文設計方法的異常值誤檢數量最少,表明其具有更高的辨識準確性。該方法利用Pair-Copula對供電計量數據非參數變量的邊緣分布情況進行分析,使得作為異常值判斷基準的置信區間更加合理,保障了異常辨識結果的準確性。

圖2 異常值錯誤識別或檢出數量對比圖
3 結束語
本文開展了基于兩步Pair-Copula的供電計量數據異常值主動辨識方法的研究。該方法在考慮關聯供電計量數據值的非參數變量連續屬性的基礎上,采用核密度估計法確定了非參數變量的具體Pair-Copula邊緣分布,確保了供電計量數據置信區間的設置能夠適應非參數變量,并根據供電計量數據與置信閾值之間的關系,實現了異常值的準確辨識。實驗結果表明,該方法的異常值未識別數量和誤識別數量均處于較低水平,能夠實現供電計量數據異常值的可靠、精準辨識。 AP
作者簡介:
張 萍 (1981-)女,江蘇泰興人,工程師,學士,現就職于國網江蘇省電力有限公司泰興市供電分公司,研究方向為計量技術。
參考文獻:
[1] 黃公躍, 付婷婷, 林思遠, 等. 用電信息采集系統電能計量數據異常識別研究[J]. 電網與清潔能源, 2023, 39 (04) : 25 - 30 + 46.
[2] 賈旭超, 馬迅, 劉安磊, 等. 基于孤立森林法的電能計量數據異常檢測方法[J]. 河北電力技術, 2023, 42 (02) : 41 - 45.
[3] 金晨. 基于深度神經網絡的電能計量異常篩選方法[J]. 數字通信世界, 2023, (01) : 84 - 86.
摘自《自動化博覽》2026年6月刊







案例頻道