0 / 9
k平均法(K-Means Clustering)
正解(どのグループか)が決まっていないデータをK個のグループに分ける方法。グループごとに中心点を1つ置き、各データを最も近い中心点のグループに入れたあと、グループに属するデータの平均の位置へ中心点を動かす。中心点がもう動かなくなるまでこれを繰り返す。名前のKは分けるグループ数、「平均」は中心点を平均の位置に置くという意味。
例: カフェの客12人を来店回数と1回の支払額で点に打ち、似た客どうしで3つのグループに分ける。
1 / 9
開始 › クラスター数の決定
分けるグループ(クラスター)の数Kを3に決める。Kはアルゴリズムが決めてくれないので、分析する人が先に決める。
2 / 9
開始 › 初期中心点の選択
データの中から3つを無作為に選び、最初の中心点(中心1・2・3)にする。今回は3つのグループから1つずつ選ばれた。
3 / 9
処理 › 距離計算
すべての客から3つの中心点までの直線距離を測る。図は右上の客1人の例。中心1まで6.6、中心2まで1.2、中心3まで5.9。
4 / 9
処理 › 割り当て
各客を最も近い中心点のグループに入れる。例の客は中心2が最も近いので中心2のグループになる。12人が3つのグループに分かれた。
5 / 9
処理 › 中心座標の再計算
グループごとに属する客の平均の位置を求め、中心点をそこへ動かす。最初の中心点は客1人の位置だったが、動かした中心点はグループの真ん中の空いた場所に来る。
6 / 9
終了 › 中心値の比較
動かしたあとの中心点(新しい中心)と動かす前の中心点(前の中心、点線の四角)を比べる。位置が変わったので終わらずに処理へ戻り、もう一度行う。
7 / 9
処理 › 距離計算・割り当て(2回目)
新しい中心点を基準に距離を測り直し、最も近い中心点のグループに入れ直す。今回は別のグループへ移る客がいない。
8 / 9
処理 › 中心座標の再計算(2回目)
グループが変わらないので平均の位置も変わらない。中心点は動かない。
9 / 9
終了 › 中心値の比較
新しい中心と前の中心が同じ。もう変わるものがないので、ここで終わる。左上・右上・右下の3つのグループに分かれた。
1 / 9
開始 › クラスター数の決定
分けるグループ(クラスター)の数Kを3に決める。1つ目のタブと同じ。
2 / 9
開始 › 初期中心点の選択
データの中から3つを無作為に選んだら、2つ(中心1・2)が左上のグループから、1つ(中心3)が右下のグループから選ばれた。右上のグループには中心点がない。
3 / 9
処理 › 距離計算
右上の客1人の距離を見ると、中心1まで6.7、中心2まで5.8、中心3まで5.2。近い中心点がないので、比べれば近い中心3が最も近い。
4 / 9
処理 › 割り当て
左上のグループは中心1と中心2のグループに分かれ、右上と右下の客8人はすべて中心3のグループになる。
5 / 9
処理 › 中心座標の再計算
中心3は右上・右下の客8人の平均の位置へ動き、2つのグループのあいだの空いた場所に置かれる。中心1・2は左上のグループの中で少しずつ動く。
6 / 9
終了 › 中心値の比較
中心点の位置が変わったので、終わらずに処理へ戻り、もう一度行う。
7 / 9
処理 › 距離計算・割り当て(2回目)
距離を測り直しても別のグループへ移る客はいない。右上の客たちには、やはり中心3が最も近い。
9 / 9
終了 › 中心値の比較
新しい中心と前の中心が同じなので終わる。ところが左上の1つのグループは2つに割れ、右の2つのグループは1つにまとめられた。k平均法は最初の中心点をどこで選ぶかによって、違う結果で止まることがある(局所最適解)。そのため最初の中心点を変えて何度か実行し、最もよくまとまった結果を選ぶ。