Databricks-Certified-Professional-Data-Engineer 試験問題 21
単体テストを PySpark アプリケーションに組み込むには、ジョブの設計に事前に注意するか、既存のコードを大幅にリファクタリングする必要があります。
この追加の取り組みを相殺する主な利点について説明しているのはどれですか?
この追加の取り組みを相殺する主な利点について説明しているのはどれですか?
Databricks-Certified-Professional-Data-Engineer 試験問題 22
データ エンジニアは、ジョブを使用して自動的に処理するようにノートブックを設定しました。データエンジニアのマネージャーが望むこと
複雑なため、スケジュールをバージョン管理する必要があります。
データ エンジニアは次のどのアプローチを使用して、バージョン管理可能な構成を取得できますか?
仕事のスケジュールは?
複雑なため、スケジュールをバージョン管理する必要があります。
データ エンジニアは次のどのアプローチを使用して、バージョン管理可能な構成を取得できますか?
仕事のスケジュールは?
Databricks-Certified-Professional-Data-Engineer 試験問題 23
時間単位のバッチ ジョブは、クラウド オブジェクト ストレージ コンテナーからデータ ファイルを取り込むように構成されており、各バッチは特定の時間にソース システムによって生成されたすべてのレコードを表します。これらのレコードを処理して Lakehouse に取り込むバッチ ジョブは、遅れて到着したデータが見逃されないように十分に遅延されます。user_id フィールドは、次のスキーマを持つデータの一意のキーを表します。
user_id BIGINT、username STRING、user_utc STRING、user_region STRING、last_login BIGINT、auto_pay BOOLEAN、last_updated BIGINT 新しいレコードはすべて、ソースと同じスキーマ内のすべてのデータの完全なレコードを保持する account_history という名前のテーブルに取り込まれます。システム内の次のテーブルは、account_current という名前で、各 uniqueuser_id の最新の値を表すタイプ 1 テーブルとして実装されます。
数百万のユーザー アカウントと数万のレコードが 1 時間ごとに処理されると仮定すると、1 時間ごとのバッチ ジョブの一部として記述された account_currenttable を効率的に更新するには、どの実装を使用できますか?
user_id BIGINT、username STRING、user_utc STRING、user_region STRING、last_login BIGINT、auto_pay BOOLEAN、last_updated BIGINT 新しいレコードはすべて、ソースと同じスキーマ内のすべてのデータの完全なレコードを保持する account_history という名前のテーブルに取り込まれます。システム内の次のテーブルは、account_current という名前で、各 uniqueuser_id の最新の値を表すタイプ 1 テーブルとして実装されます。
数百万のユーザー アカウントと数万のレコードが 1 時間ごとに処理されると仮定すると、1 時間ごとのバッチ ジョブの一部として記述された account_currenttable を効率的に更新するには、どの実装を使用できますか?
Databricks-Certified-Professional-Data-Engineer 試験問題 24
Databricks ジョブで 2 つのタスクを設定するように求められます。最初のタスクはノートブックを実行してリモート システムからデータをダウンロードし、2 番目のタスクはこのデータを処理できる DLT パイプラインです。ジョブでこれをどのように構成する予定ですか? UI
Databricks-Certified-Professional-Data-Engineer 試験問題 25
ジョブ クラスターの開始に 6 ~ 8 分かかっており、これによりジョブが時間どおりに終了するのが遅れています。クラスターの起動時間を短縮するために実行できる手順は何ですか?



