METHOD GUIDE / CHAPTER 08

異常検知の手法を探す

データの中から通常とは異なる値やパターンを見つける手法です。 不正取引の検出、設備の予兆保全、品質異常の発見などに活用します。

CHAPTER 08
ANOMALY DETECTION

異常検知

多くのデータの中から、通常と異なる値や振る舞いを捉える。 異常を見つけるだけでなく、その原因を確かめ、業務上の判断につなげます。

METHOD 33

外れ値検出

OUTLIER DETECTION
◎
PURPOSE 他と大きく異なる値を見つけたい
⌁
CATEGORY 08 異常検知

多くのデータの中から、ほかの値と比べて極端に大きい・小さいなど、 通常の範囲から大きく外れたデータを見つける方法。 統計的な基準やデータの分布を使って候補を抽出します。

OUTLIER 通常のデータ群
A 極端な数値や通常と異なる観測値を抽出する
B 入力ミスや測定エラーの候補を見つける
C 重要な例外事象を調査するきっかけを作る

通常より極端に高い注文金額を発見

受注データの金額分布を確認し、一般的な取引と大きく異なる注文を抽出。 入力ミスなのか、大口顧客による正当な注文なのかを確認し、 修正や追加対応につなげます。

受注管理品質管理データ点検

平均からの距離、四分位範囲(IQR)、標準偏差などを基準に、 通常と大きく異なる観測値を判定します。 適切な基準はデータの分布や業務上の目的によって異なります。

+ メリット

比較的シンプルな基準から始められ、結果を説明しやすい。

! 留意点

外れ値は必ずしも誤りではありません。機械的な削除は重要な情報を失う場合があります。

01中心を見る 平均値や中央値を確認する
02ばらつきを見る 通常範囲の広さを把握する
03原因を確認 誤りか重要な例外かを判断する
POINT

「通常と違う」ことと「間違っている」ことは別です。検出後の原因確認が重要です。

METHOD 34

Isolation Forest

ISOLATION FOREST / 孤立木
◇
PURPOSE 大量のデータから異常なパターンを検出したい
⌁
CATEGORY 08 異常検知

データをランダムな条件で繰り返し分割し、 少ない分割回数でほかのデータから孤立する点ほど 「異常らしい」と判断する機械学習手法。 複数の分割木を組み合わせて判定します。

ISOLATED 分割を繰り返す領域
A 多数の項目を使って異常な観測値を抽出する
B 異常ラベルがなくても候補を検出する
C 大量データから調査対象を絞り込む

通常と異なる取引パターンを抽出

取引金額、時間帯、頻度など複数の特徴をもとに、 ほかの取引から孤立しやすいデータを検出。 不正の可能性がある取引や入力異常の候補を絞り込み、 担当者の確認につなげます。

不正検知取引分析設備監視

ランダムに特徴量と分割位置を選び、データを分割する木を多数作ります。 それぞれの木で孤立するまでの経路の長さを集計し、 平均的に短いデータを異常候補として評価します。

+ メリット

異常データの正解ラベルがなくても利用でき、大量のデータにも適用しやすい。

! 留意点

検出された理由を業務担当者が直感的に理解しにくい場合があります。

01ランダムに分ける 特徴量と分割位置を選択する
02分割を重ねる 各データが孤立するまで追う
03経路の長さで評価 早く孤立するほど異常らしい
POINT

「ほかのデータから孤立しやすいか」が判断の中心です。異常スコアは調査対象を絞るために活用します。

METHOD 35

One-Class SVM

ONE-CLASS SUPPORT VECTOR MACHINE
◯
PURPOSE 正常データを基準に異常を見つけたい
⌁
CATEGORY 08 異常検知

主に正常なデータの分布を学習し、その範囲から外れる観測値を 異常候補として検出する手法。 カーネル関数を使うことで、複雑な形状の正常領域にも対応できます。

ANOMALY NORMAL 学習された正常領域
A 正常な振る舞いから外れるデータを抽出する
B 複数の特徴量を組み合わせて境界を学習する
C 異常事例が少ない状況でも検知の仕組みを作る

設備の通常運転からの逸脱を検出

正常稼働時の温度、振動、圧力などを学習し、 その組み合わせが通常の範囲から外れたときに異常候補として検出。 故障の兆候を調査するためのアラートに活用します。

予兆保全設備監視品質管理

学習データを基準として正常領域の境界を求めます。 新しいデータがその境界の内側か外側かを判定することで、 正常な振る舞いからの逸脱を検出します。 学習データに異常が多く混入しないよう注意が必要です。

+ メリット

異常の具体例を大量に集めなくても、正常データを中心にモデルを作れる。

! 留意点

特徴量の尺度やパラメータに影響されやすく、大規模データでは計算負荷が高くなる場合があります。

01正常データを集める 通常運転時の特徴を用意する
02正常範囲を学習 データを囲む境界を求める
03外側を検知 新しいデータの逸脱を判定する
POINT

モデルが学習する「正常」の質が重要です。季節変動や設備の運転条件が変わる場合は、判定基準の見直しも必要です。