令和6年度 科目A 問15
システム戦略
非構造化データに関する問題
ビッグデータ分析の前段階として,非構造化データを構造化データに加工する処理を記述している事例はどれか。
- ア関係データベースに蓄積された大量の財務データから必要な条件に合致するデータを抽出し,利用者が扱いやすい表計算ソフトウェアデータに加工する。
- イ個人情報を含むビッグデータを更に利活用するために,特定の個人を識別することができないように匿名化加工する。
- ウ住所データ項目の中にある,“ヶ”と“が”の混在や,丁番地の表記不統一を,標準化された表記へ統一するために加工する。
- エソーシャルメディアの口コミを機械学習によって単語ごとに分解し,要約を作り,分析可能なデータに加工し,関係データベースに保管する。
答えと解説を見る
✓ これが正解エソーシャルメディアの口コミを機械学習によって単語ごとに分解し,要約を作り,分析可能なデータに加工し,関係データベースに保管する。
解説
口コミの文章を分解・要約し、データベースに収める事例が該当します。
非構造化データとは、文章や画像、音声のように、決まった項目と型に整理されていないデータです。ソーシャルメディアの口コミは自由に書かれた文章なので、そのままでは集計や検索がしにくい非構造化データにあたります。これを機械学習で単語ごとに分解し、要約して分析できる形に整え、関係データベースに保管する流れは、非構造化データを構造化データへ加工する処理そのものです。ほかの事例は、元のデータがすでに項目の決まった形になっているか、そもそもデータの形を変える処理ではないかのどちらかです。加工の前が自由な文章などか、項目のそろった表か、を確かめるとビッグデータの前処理の事例を見分けられます。
ほかの選択肢はなぜ違うのか
- ア関係データベースに蓄積された大量の財務デ…:関係データベースの財務データは、もともと項目と型が決まった構造化データです。それを条件で抽出して表計算ソフトウェアの形式に移すのは、構造化されたデータ同士の変換であり、非構造化データの加工ではありません。
- イ個人情報を含むビッグデータを更に利活用す…:特定の個人を識別できないように加工するのは、個人情報を含むデータを利活用するための匿名化です。データの形を整える処理ではなく、プライバシーを守るための加工なので、設問の処理とは目的が違います。
- ウ住所データ項目の中にある,“ヶ”と“が”…:住所の表記ゆれをそろえるのは、データの品質を高めるデータクレンジングの一例です。住所という項目が決まったデータの中身を統一するだけで、非構造化データを構造化する処理ではありません。
この問題の用語
- ビッグデータ量が多く、種類もさまざまで、次々に発生し続けるデータのまとまり。これまでのやり方では扱いきれない規模になります。
- 分析集めたデータを細かく分けて、何がどう関わっているかを読み取ること。量が増えるほど、扱う道具も考え方も変わります。
- 関係データベースデータを表の形で持ち、表どうしを結びつけて扱う、最も広く使われているデータベース。データの定義や操作にはSQLを使います。
- 機械学習大量のデータから、きまりを自分で見つけ出させるやり方です。集めて整えたデータを分析し、新しい傾向を導く段階で使います。
出典:令和6年度 基本情報技術者試験 科目A 問15
同じ用語が出る問題
- 令和6年度 科目A 問18:HRテックの説明(ビッグデータ)
- 令和元年度 秋期 午前 問73:機械学習の活用事例(機械学習)
- 令和元年度 秋期 午前 問63:ビッグデータの特徴に沿った取扱い(ビッグデータ)
- 平成31年度 春期 午前 問4:教師あり学習の説明(機械学習)
- 平成29年度 春期 午前 問25:関数従属に関する問題(関係データベース)
この解説に誤りを見つけたら教えてください。直して、直した記録を残します。誤りを報告する(メールが開きます)