Databricks-Certified-Professional-Data-Engineer 試験問題 36
特定の雑誌の月間購読者数の合計を予測するモデルを作成するように求められます。
1 年分のサブスクリプションおよび支払いデータ、ユーザー人口統計データ、および 10 年分のデータが提供されます。
雑誌のコンテンツ(記事と写真)の価値。どのアルゴリズムが構築に最も適しているか
加入者のための予測モデル?
1 年分のサブスクリプションおよび支払いデータ、ユーザー人口統計データ、および 10 年分のデータが提供されます。
雑誌のコンテンツ(記事と写真)の価値。どのアルゴリズムが構築に最も適しているか
加入者のための予測モデル?
Databricks-Certified-Professional-Data-Engineer 試験問題 37
CSV、JSON、TEXT、BINARY 形式を使用して外部テーブルを定義する場合、外部テーブルに対するクエリはパフォーマンス上の理由からデータと場所をキャッシュするため、特定の Spark セッション内では、到着した可能性のある新しいファイルは最初のセッション後に使用できなくなります。クエリ。この制限にどう対処すればよいでしょうか?
Databricks-Certified-Professional-Data-Engineer 試験問題 38
運用チームは集中型のデータ品質監視システムを使用しており、ユーザーは Webhook を通じてデータ品質メトリクスを公開できます。重複レコードが少なくとも 1 つある場合に Webhook を使用してメッセージを送信するプロセスを開発するように求められました。次のアプローチのうちどれが考えられますか?現在のデータ品質監視システムとアラートを統合するために採用されました
Databricks-Certified-Professional-Data-Engineer 試験問題 39
デルタ ライブ テーブル パイプラインには、STREAMING LIVE TABLE を使用して定義された 2 つのデータセットが含まれています。
LIVE TABLE を使用して、Delta Lake テーブル ソースに対して 3 つのデータセットが定義されます。テーブルは次のように構成されています
トリガーされたパイプライン モードを使用して開発モードで実行します。
以前に処理されていないデータが存在し、すべての定義が有効であると仮定すると、その後の期待される結果は何ですか?
「開始」をクリックしてパイプラインを更新しますか?
LIVE TABLE を使用して、Delta Lake テーブル ソースに対して 3 つのデータセットが定義されます。テーブルは次のように構成されています
トリガーされたパイプライン モードを使用して開発モードで実行します。
以前に処理されていないデータが存在し、すべての定義が有効であると仮定すると、その後の期待される結果は何ですか?
「開始」をクリックしてパイプラインを更新しますか?
Databricks-Certified-Professional-Data-Engineer 試験問題 40
各デバイスごとに温度センサーがしきい値温度 (100.00) を超えた回数を特定するように求められました。各行には 5 分ごとに収集された 5 つの測定値が含まれており、空白に適切な関数を入力します。
スキーマ: deviceId INT、deviceTemp ARRAY<double>、dateTimeCollected TIMESTAMP

SELECT deviceId, __ (__ (__(deviceTemp], i -> i > 100.00)))
FROMデバイス
GROUP BY デバイス ID
スキーマ: deviceId INT、deviceTemp ARRAY<double>、dateTimeCollected TIMESTAMP

SELECT deviceId, __ (__ (__(deviceTemp], i -> i > 100.00)))
FROMデバイス
GROUP BY デバイス ID


