変数選択付き混合型クラスター(STATS MIXED CLUSTER2)
変数の選択とクラスター数の決定を、クラスタリングと同時に行う拡張手続きです。
連続変数とカテゴリ変数が混在するデータを対象に、分類に効く変数を絞り込み、適切なクラスター数の決定を支援します。SPSS Statistics 32 で Extension Hub から追加できる R の拡張です。
ご相談は製品に詳しい専門スタッフが承ります。IBM SPSS 正規販売店です。
- 連続変数とカテゴリ変数の混在データ
- クラスタリングに効く変数の選択
- クラスター数の決定の支援
変数選択付き混合型クラスターの要点
変数選択付き混合型クラスター(STATS MIXED CLUSTER2)は、連続変数とカテゴリ変数が混在するデータを、変数の選択とクラスター数の決定を含めて一つの手続きで分類する拡張手続きです。SPSS Statistics 31.0.2 で追加された混合型クラスター(STATS MIXED CLUSTER)に、変数選択の機能を加えた発展版にあたります。
- 種別
- 拡張機能(R)
- 対応バージョン
- SPSS Statistics 32 以降
- 導入
- Extension Hub からインストール
- 向いている分析
- 顧客セグメンテーション・対象者の類型化
一つの手続きで3つの工程を進める
通常のクラスター分析では、使う変数とクラスター数を分析者が先に決めてから分類を実行します。STATS MIXED CLUSTER2 は、この2つを分類と同時に扱います。
混合型データをそのまま分類
購買額のような連続変数と、会員区分のようなカテゴリ変数を、一つの枠組みでクラスタリングします。変数の型をそろえる前処理をせずに進められます。
分類に効く変数を絞り込む
候補として指定した変数の中から、クラスタリングに有効な変数を選びます。分類に寄与しない変数の影響を抑え、クラスターの輪郭を保ちます。
クラスター数の決定を支援
いくつのクラスターに分けるかを判断するための出力が得られます。最終的なクラスター数は、分析の目的と解釈のしやすさに照らして分析者が決めます。
候補の変数から、分類に効く変数が選ばれる
クラスター分析は、あらかじめ正解のグループが与えられていないデータから、性質の似た対象どうしのまとまりを見つける手法です。分類に関係の薄い変数が多く入ると、クラスターの境界がぼやけます。
STATS MIXED CLUSTER2 は、候補の変数それぞれが分類にどれだけ効いているかをデータから判断し、有効な変数でクラスターを構成します。変数の取捨選択とクラスター数の検討をデータにもとづいて進めるため、分類の根拠を説明しやすくなります。
連続変数とカテゴリ変数が混ざったデータは、顧客データ、臨床データ、アンケートのいずれでもよく見られます。この手続きは、そうしたデータを型ごとに分けずに扱います。
混合型クラスター(31.0.2)との使い分け
SPSS Statistics 31.0.2 の混合型クラスター(STATS MIXED CLUSTER)は、混合型データのクラスタリングを行う拡張手続きです。32 の STATS MIXED CLUSTER2 は、これに変数選択を加えています。
| 観点 | 混合型クラスター(31.0.2) | 変数選択付き混合型クラスター(32) |
|---|---|---|
| 拡張の名前 | STATS MIXED CLUSTER | STATS MIXED CLUSTER2 |
| 混合型データ | 対応 | 対応 |
| 使う変数 | 指定した変数をすべて使う | 候補から有効な変数を選ぶ |
| クラスター数 | 分析者が決める部分が大きい | 決定を支援する出力がある |
| 向いている場面 | 使う変数が決まっているとき | 変数の絞り込みまで手続きに任せたいとき |
導入から出力の確認まで
拡張手続きのため、はじめに Extension Hub からインストールします。
拡張ハブから追加
「拡張」メニューの「拡張ハブ(Extension Hub)」で STATS MIXED CLUSTER2 を検索し、インストールします。
手続きを呼び出す
インストール後、分析メニューに追加された項目から手続きを開きます。
候補の変数を指定して実行
連続変数とカテゴリ変数が混在したまま候補の変数を指定し、変数選択やクラスター数のオプションを必要に応じて設定して実行します。
出力を検討
選ばれた変数、クラスター数、各クラスターの特徴を確認します。
導入時の確認事項
この拡張は R プラグインを利用します。初回の実行時に R パッケージのダウンロードが必要になる場合があります。ネットワークに制限がある環境では、CRAN ミラーの設定(spssprod.inf の CranURL キー)を使えます。メニューの正確な位置とオプションの詳細は IBM のドキュメントでご確認ください。
クラスターに呼び名を付けられるか
出力されたクラスターは、選ばれた変数の値を手がかりに、それぞれがどのような特徴を持つグループなのかを読み解きます。「購買額が高く来店頻度も多いグループ」のように、各クラスターに意味のある呼び名を付けられるかどうかが、結果を研究や施策に使えるかの目安になります。
クラスター数は、手続きが示す判断材料と、分析の目的・解釈のしやすさを合わせて決めます。クラスターの数や中身が解釈しにくいときは、候補の変数やオプションを見直して再実行します。
クラスター分析は、データの中のまとまりを記述する手法です。得られたクラスターと他の変数との関係を論じる場合は、別の分析で確かめます。
k-means 法などとの違い
| 観点 | 変数選択付き混合型クラスター | 一般的なクラスター分析(k-means 法など) |
|---|---|---|
| データの型 | 連続・カテゴリの混在に対応 | 連続変数向けが基本 |
| 変数の選択 | 手続きの中で絞り込む | 事前に分析者が決める |
| クラスター数 | 決定を支援する | 事前に指定することが多い |
| 向いている場面 | 変数が多く、型も混在するデータ | 変数とクラスター数が定まっているとき |
使う変数とクラスター数が定まっていれば、k-means 法や TwoStep クラスターなど SPSS Statistics の標準の手続きで手早く分類できます。
分野別の使いどころ
顧客セグメンテーション
購買額や来店頻度(連続)と、会員区分や利用チャネル(カテゴリ)が混在する顧客データから、セグメントに効く変数だけで分類します。
患者・対象者の類型化
検査値(連続)と既往歴の有無や治療区分(カテゴリ)を組み合わせ、対象者のタイプ分けを行う研究に使えます。
アンケート回答者の分類
数値評価と選択式の設問が混ざった調査データから回答者をタイプに分け、分類に効いている設問を把握します。
よくある質問
「混合型」とは何を指しますか?
連続変数(数値)とカテゴリ変数(分類)が混在するデータのことです。STATS MIXED CLUSTER2 は、こうしたデータを型ごとに分けずに扱います。
31.0.2 の混合型クラスターとどちらを使えばよいですか?
使う変数があらかじめ決まっているなら、31.0.2 の混合型クラスター(STATS MIXED CLUSTER)で対応できます。変数の絞り込みまで手続きに任せたい場合は、32 の変数選択付き混合型クラスター(STATS MIXED CLUSTER2)が向いています。
クラスター数は手続きが決めてくれるのですか?
クラスター数の決定を支援する出力が得られます。最終的なクラスター数は、分析の目的や解釈のしやすさと照らして分析者が決めます。
候補の変数が多くても使えますか?
多数の候補から分類に有効な変数を絞り込むことが、この手続きの利点です。候補の変数が多いデータほど、変数選択の効果が出やすくなります。
導入に必要な環境は?
SPSS Statistics 32 以降と、R プラグインが使える環境が必要です。Extension Hub から名前で検索してインストールします。初回は R パッケージの取得が発生するため、ネットワークに制限がある場合は CRAN ミラーの設定をお使いください。
変数選択付き混合型クラスターのご相談
お手元のデータで使えるか、31 からのアップグレードが必要かなど、分析の内容をうかがってご案内します。
お電話でも承ります0120-835-761平日 9:00–18:00
セミナーのお知らせ
