Associate-Developer-Apache-Spark-3.5 試験問題 1
エンジニアは2つのDataFrame(df1(小)とdf2(大))を持っています。ブロードキャスト結合を使用します。
パイソン
コピー編集
pyspark.sql.functionsからブロードキャストをインポートする
結果 = df2.join(broadcast(df1), on='id', how='inner')
このシナリオでbroadcast() を使用する目的は何ですか?
オプション:
パイソン
コピー編集
pyspark.sql.functionsからブロードキャストをインポートする
結果 = df2.join(broadcast(df1), on='id', how='inner')
このシナリオでbroadcast() を使用する目的は何ですか?
オプション:
Associate-Developer-Apache-Spark-3.5 試験問題 2
あるデータエンジニアは、毎日最新のデータで上書きされるParquetテーブルの作成を依頼されました。このParquetテーブルの下流の利用者には、このテーブル内のすべてのレコードがmarket_timeフィールドでソートされた状態でデータが生成されることが必須要件となっています。
これらの要件を満たす Parquet テーブルを生成するのは、Spark コードのどの行ですか?
これらの要件を満たす Parquet テーブルを生成するのは、Spark コードのどの行ですか?
Associate-Developer-Apache-Spark-3.5 試験問題 3
あるeコマース企業のデータサイエンティストは、サブスクライバーデータベースから取得したユーザーデータを処理しており、そのデータをDataFrame df_userに格納しています。このデータをさらに処理する前に、データサイエンティストは別のDataFrame df_user_non_piiを作成し、このDataFrameにPII以外の列のみを格納したいと考えています。df_userのPII列は、first_name、last_name、email、birthdateです。
この要件を満たすために使用できるコード スニペットはどれですか?
この要件を満たすために使用できるコード スニペットはどれですか?
Associate-Developer-Apache-Spark-3.5 試験問題 4
データ エンジニアは、feed と呼ばれる Kafka トピックから読み取るストリーミング データフレームを作成したいと考えています。

要件を満たすには、5 行目にどのコード フラグメントを挿入する必要がありますか?
コードコンテキスト:
スパーク\
.readStream \
.format("カフカ") \
.option("kafka.bootstrap.servers", "ホスト1:ポート1,ホスト2:ポート2") \
.[5行目] \
。負荷()
オプション:

要件を満たすには、5 行目にどのコード フラグメントを挿入する必要がありますか?
コードコンテキスト:
スパーク\
.readStream \
.format("カフカ") \
.option("kafka.bootstrap.servers", "ホスト1:ポート1,ホスト2:ポート2") \
.[5行目] \
。負荷()
オプション:
Associate-Developer-Apache-Spark-3.5 試験問題 5
データ エンジニアは、列国別にパーティション化された DataFramedf を Parquet ファイルに書き込み、宛先パスにある既存のデータを上書きする必要があります。
データ エンジニアは、Apache Spark でこのタスクを実行するためにどのコードを使用すればよいですか。
データ エンジニアは、Apache Spark でこのタスクを実行するためにどのコードを使用すればよいですか。
