令和3年度 秋期 午前Ⅱ 問18
データベース応用
Apache Sparkの特徴
ビッグデータ処理基盤に利用され,オープンソースソフトウェアの一つである Apache Spark の特徴はどれか。
- アMapReduce の考え方に基づいたバッチ処理に特化している。
- イRDD(Resilient Distributed Dataset)と呼ばれるデータ集合に対して変換を行う。
- ウパブリッシュ/サブスクライブ(Publish / Subscribe)型のメッセージングモデルを採用している。
- エマスタノードをもたないキーバリューストアである。
答えと解説を見る
✓ これが正解イRDD(Resilient Distributed Dataset)と呼ばれるデータ集合に対して変換を行う。
解説
Apache Spark は RDD というデータ集合に変換を施して処理します。
Apache Spark は、大量のデータを複数のコンピュータで分散して処理する基盤です。中心となるのが RDD(Resilient Distributed Dataset)と呼ばれるデータ集合で、プログラムは RDD に変換の操作を順に適用していく形で処理を記述します。RDD は複数のノードに分けて置かれ、途中結果をメモリ上に保持しながら処理を進められるため、同じデータに何度も手を加える反復的な処理を得意とします。このため、RDD に対して変換を行うという記述が Spark の特徴を表しています。分散処理の基盤ごとに、何をデータの単位として扱うかを押さえておくと、選択肢を見分けやすくなります。
ほかの選択肢はなぜ違うのか
- アMapReduce の考え方に基づいたバ…:MapReduce の考え方に基づいたバッチ処理は、Hadoop で用いられてきた処理の形です。Spark はバッチ処理に限らず、メモリ上で途中結果を使い回す反復処理やストリーム処理にも用いられるので、バッチ処理に特化しているとはいえません。
- ウパブリッシュ/サブスクライブ(Publi…:パブリッシュ/サブスクライブ型のメッセージングモデルは、送り手が出したメッセージを、購読を登録した受け手へ配る仕組みです。データ集合に変換を施していく Spark の処理モデルとは異なり、メッセージを仲介する基盤の特徴です。
- エマスタノードをもたないキーバリューストア…:マスタノードをもたないキーバリューストアは、全てのノードが対等な立場でキーと値の組を保存する分散データベースの説明です。Spark はデータを保存するデータベースではなく、データを処理するための基盤なので該当しません。
この問題の用語
- ビッグデータ量が多く、種類もさまざまで、次々に発生し続けるデータのまとまり。これまでのやり方では扱いきれない規模になります。
出典:令和3年度 秋期 データベーススペシャリスト試験 午前Ⅱ 問18
同じ用語が出る問題
- 令和6年度 秋期 午前Ⅱ 問16:CEPに関する問題(ビッグデータ)
- 令和4年度 秋期 午前Ⅱ 問17:機械学習に関する問題(ビッグデータ)
- 平成31年度 春期 午前Ⅱ 問19:CEPに関する問題(ビッグデータ)
この解説に誤りを見つけたら教えてください。直して、直した記録を残します。誤りを報告する(メールが開きます)