ゲノム解析
(Genomic Analysis)
ゲノムデータを SPSS に直接取り込み、そのまま統計分析へ進めます。
.fastq/.fq 形式のゲノム配列ファイルを読み込み、SPSS のデータセットに変換します。変換はバックグラウンドのジョブとして進むため、そのあいだも別の分析を続けられます。変換後は記述統計・相関・回帰など、いつもの手続きをそのまま使えます。
ご相談は製品に詳しい専門スタッフが承ります。IBM SPSS 正規販売店です。

ゲノム解析の要点
SPSS Statistics 32 のゲノム解析は、.fastq/.fq 形式のゲノムデータを SPSS に取り込み、SPSS のデータセットに変換する機能です。取り込みから記述統計・相関・回帰までを、一つの環境で続けて進められます。
- 種別
- データの取り込み・前処理
- 対応バージョン
- SPSS Statistics 32 以降
- メニュー
- 変換 > ゲノム解析
- 向いている分析
- ゲノム由来の指標と臨床・表現型データの関連の検討
SPSS 32 のゲノム解析でできること
取り込み・変換・その後の統計分析までを SPSS Statistics 32 のなかで進められます。
図1 ゲノムデータの取り込みから統計分析までの流れ
ゲノムデータの取り込みと変換
.fastq/.fq 形式のゲノム配列ファイルを読み込み、SPSS のデータセットに変換します。変換後は、ふだんの SPSS データと同じように扱えます。
バックグラウンドのジョブ処理
容量の大きいファイルの変換は、バックグラウンドのジョブとして実行します。進行中もジョブの状態を確認でき、途中で取り消すこともできます。
変換中も別の分析を進める
変換が走っているあいだも、SPSS のほかの統計手続きを実行できます。重い処理と並行して、手元のデータの分析を続けられます。
配列データを「行と列」のデータにする
SPSS がふだん扱うデータは、行が観測対象、列が変数という表形式です。ゲノムデータは塩基配列という連続した記号列が中心で、そのままでは行と列の形になっていません。
これまでは、専用ツールで配列を加工して指標を表形式のファイルに書き出し、それを統計ソフトに読み込み直す流れが一般的でした。SPSS Statistics 32 のゲノム解析は、この取り込みと変換の部分を SPSS のなかに持ち込んだ機能です。ツールをまたぐデータの受け渡しが減るため、どのファイルをどう読み込んだかを SPSS 側で一貫して管理でき、分析の再現性を保ちやすくなります。
ゲノム解析はオープンソースのツールと連携して、ゲノムデータの取り込み・クレンジング・前処理を行います。前処理を終えたデータは、そのまま回帰・相関・記述統計などの SPSS の手続きで分析できます。遺伝関連研究、バイオマーカー研究、高次元データの解析を支える機能です。
配列のアラインメントや変異検出といった配列レベルの前処理は、引き続き専用のバイオインフォマティクスツールが受け持ちます。SPSS のゲノム解析は、専用ツールと統計分析をつなぐ位置にあります。
図2 専用ツールと SPSS Statistics 32 の分担
ゲノム解析の使い方
取り込み・変換・分析の3段階で進みます。
ファイルを用意する
分析に使うゲノムデータのファイル(.fastq/.fq)を用意します。容量が大きくなりやすいため、ディスクの空きも確認しておきます。
取り込みを指定する
メニューの「変換 > ゲノム解析」を開き、対象のファイルを指定して取り込みます。
ジョブの進行を確認する
取り込み・変換はバックグラウンドのジョブとして始まります。状態を確認しながら待ち、不要になったジョブは取り消します。
データセットで分析する
変換が終わったら SPSS のデータセットとして開き、記述統計・度数分布・相関・回帰などを適用します。
動作環境
対応形式やプラットフォームごとの要件は、IBM の最新ドキュメントもあわせてご確認ください。Linux のサーバー環境などでは、ゲノム解析の実行に追加の構成が必要になることがあります。導入前の確認は、ご相談の際にご案内します。
データセットにしたあとの統計分析
変換後のデータには、SPSS の通常の手続きがそのまま使えます。
| 手続き | 使いどころ |
|---|---|
| 記述統計 | ゲノム由来の指標の平均・分散・分布の形を把握する |
| 度数分布 | カテゴリ的な特徴の出現頻度を整理する |
| 相関分析 | 複数の指標のあいだの関連を調べる |
| 回帰分析 | ゲノム由来の指標と、表現型・臨床アウトカムとの関係をモデル化する |
多数の指標を検定するとき
ゲノム由来の指標は数が多くなりやすく、一つずつ検定を重ねると偶然の有意が混ざります。多重比較の補正を分析計画の段階で決めておきます。回帰で得られる係数は指標とアウトカムの関連の大きさを表すもので、因果の向きは研究デザインとあわせて判断します。
専用バイオインフォマティクスツールとの使い分け
| 観点 | SPSS Statistics 32 ゲノム解析 | 専用バイオインフォマティクスツール |
|---|---|---|
| 主な役割 | ゲノムデータの取り込み・変換と、その後の統計分析 | 配列のアラインメント・変異検出など専門的な前処理 |
| 操作 | SPSS の通常の手続きと同じ感覚で扱える | コマンドライン操作と専門知識を前提とするものが多い |
| 強み | 統計分析との連続性、表形式データとの統合 | ゲノム特有の高度な処理と豊富な解析パイプライン |
| 向いている場面 | 取り込んだ指標を統計的に検討するとき | 配列レベルの精密な解析をするとき |
分野別の活用例
疾患研究
ゲノム由来の指標と、疾患の有無や重症度との関連を統計的に検討します。変換の工程が短くなる分、仮説検証の回転を上げられます。
創薬研究
薬剤の反応性に関わる指標の探索など、創薬の初期段階での統計的なスクリーニングに使えます。
個別化医療
個人のゲノム情報と臨床データを結びつけた分析を、取り込みから同じ環境で進められます。
公衆衛生・疫学研究
集団レベルのゲノム指標と、生活習慣・環境要因・健康アウトカムを組み合わせた検討に。大規模なコホートデータの取り込みを SPSS 側で進められます。
使いはじめる前に確認すること
バージョンとファイル
IBM SPSS Statistics 32 以降と、取り込むゲノムデータのファイル(.fastq/.fq)を用意します。
容量と処理時間
ゲノムデータは大容量になりやすいため、ディスク容量と処理時間に余裕を持たせます。ジョブの状態はこまめに確認し、不要なジョブは取り消して資源を空けます。
データの取り扱い
ゲノム情報は機微な個人情報を含みうるため、所属機関の倫理規程・情報セキュリティ規程に沿って扱います。
よくある質問
どの形式のゲノムデータを取り込めますか?
IBM の情報では、.fastq および .fq 形式のゲノム配列ファイルに対応しています。対応形式の最新の詳細は、IBM のドキュメントでご確認ください。
操作に専門的な知識は必要ですか?
取り込みと変換の操作は、SPSS の通常の手続きと同じ感覚で行えます。変換後のデータをどう分析し、どう解釈するかには、ゲノム研究と統計分析の双方の知識を使います。
変換中にほかの分析を実行できますか?
はい。取り込み・変換はバックグラウンドのジョブとして処理されるため、そのあいだもほかの統計手続きを実行できます。ジョブの状態確認や取り消しもできます。
変換したデータは通常の SPSS データと同じように扱えますか?
はい。SPSS のデータセットに変換したあとは、記述統計・度数分布・相関・回帰など、通常の統計手続きをそのまま適用できます。
どのエディションで使えますか?
ゲノム解析は SPSS Statistics 32 で追加された機能です。エディションごとの可否やプラットフォームごとの要件は、ご相談の際にご案内します。
専用のバイオインフォマティクスツールとはどう分担しますか?
配列のアラインメントや変異検出といった前処理は専用ツールが受け持ち、SPSS のゲノム解析はデータの取り込み・変換と、その後の統計分析を受け持ちます。
ゲノムデータの分析を SPSS で進めるご相談
取り込むデータの形式、動作環境、変換後の分析の組み立てまで、研究の内容に合わせてご案内します。
お電話でも承ります0120-835-761平日 9:00–18:00
セミナーのお知らせ
