Apache Spark の特徴

正解の理由 Apache Spark は、大規模データ処理向けのオープンソース分散コンピューティングフレームワークです。 中核となるデータモデルとして「RDD(Resilient Distributed Dataset: 弾力性分散データセット)」を採用しています。RDDは分散クラスタ上のメモリ内に保持される不変のデータコレクションであり、次の2つの操作を通じてデータ処理パイプラインを構築します。 変換(Transformation): `map` や `filter` など、既存のRDDから新しいRDDを生成する遅延評価操作。 アクション(Action): `count` や `collect` など、計算を実行して結果を返す操作。 ディスクI/Oを頻繁に行うHadoop MapReduceに比べ、メモリ上で中間データを保持するため最大100倍高速に処理できます。したがって、イが正解です。 各選択肢の解説 Hadoop MapReduce の説明です。Spark はバッチ処理だけでなく、ストリーミング処理や機械学習など多様な処理に対応しています。 正しい記述です。RDDと呼ばれる抽象化された分散データ集合に対して変換・操作を行います。 Apache Kafka などのメッセージングミドルウェアの説明です。 Apache Cassandra などの分散キーバリューストア(KVS)の説明です。Spark はドライバノードとクラスタマネージャによるマスタ・ワーカー構成をとります。

ビッグデータ処理基盤に利用され,オープンソースソフトウェアの一つである Apache Spark の特徴はどれか。

出典2021r03a_db_am2_問18
ア
MapReduce の考え方に基づいたバッチ処理に特化している。
イ
RDD (Resilient Distributed Dataset) と呼ばれるデータ集合に対して変換を行う。
ウ
パブリッシュ/サブスクライブ (Publish / Subscribe) 型のメッセージングモデルを採用している。
エ
マスタノードをもたないキーバリューストアである。