令和5年度 春期 午前Ⅱ 問3
業務分析・データ利活用
多数の被験者の検診データから,説明変数である年齢,飲酒の頻度及び喫煙本数が,目的変数であるガンの発症の有無に及ぼす影響を統計的に分析した上で,ある人の年齢,飲酒の頻度及び喫煙本数から,その人のガンの発症確率を推定するモデルを構築した。このとき用いられる分析手法はどれか。
検診データのサンプル
| 年齢 | 飲酒の頻度(回/週) | 喫煙本数(本/週) | ガンの発症の有無 |
|---|---|---|---|
| 50 | 7 | 70 | 有 |
| 40 | 5 | 40 | 有 |
| 55 | 2 | 10 | 無 |
| 45 | 5 | 0 | 無 |
- アABC分析
- イクラスター分析
- ウ主成分分析
- エロジスティック回帰分析
答えと解説を見る
✓ これが正解エロジスティック回帰分析
解説
有無という二値の結果の発生確率を推定するのはロジスティック回帰分析です。
ロジスティック回帰分析は、複数の説明変数から、ある事象が起こるかどうかという二値の目的変数について、その発生確率を推定する手法です。見分ける軸は、目的変数が何で、何を求めているかです。設問では、年齢、飲酒の頻度、喫煙本数を説明変数、ガンの発症の有無を目的変数として、ある人の発症確率を推定するモデルを作っています。目的変数が有か無かの二つの値しかとらず、その確率を0から1の範囲で求めるという点が、ロジスティック回帰分析の使いどころと一致します。目的変数がある分析で、その答えが有無の二択なら確率を求める回帰、と結び付けて覚えると、目的変数を使わない分析手法と区別できます。
ほかの選択肢はなぜ違うのか
- アABC分析:ABC分析は、商品などを売上高などの大きい順に並べ、累計比率で三つのランクに分けて重点管理の対象を決める手法です。説明変数から発症の確率を推定するモデルを作る用途とは違います。
- イクラスター分析:クラスター分析は、データ同士の似ている度合いをもとに、対象をいくつかのグループに分ける手法です。正解となる目的変数をもたずに分類するので、発症の有無という目的変数の確率を推定する用途には合いません。
- ウ主成分分析:主成分分析は、多数の変数を、情報をなるべく失わないように少数の総合的な指標にまとめる手法です。変数を要約するのが目的で、ある事象の発生確率を推定するモデルを作る手法ではありません。
この問題の用語
- 分析集めたデータを細かく分けて、何がどう関わっているかを読み取ること。量が増えるほど、扱う道具も考え方も変わります。
出典:令和5年度 春期 ITストラテジスト試験 午前Ⅱ 問3
この解説に誤りを見つけたら教えてください。直して、直した記録を残します。誤りを報告する(メールが開きます)