Databricks-Certified-Data-Engineer-Professional 試験問題 71

データ エンジニア チームは、Databricks でネイティブ コネクタがサポートされていない外部データベースへの接続を構成するよう指示されています。外部データベースには、グループ メンバーシップによるデータ セキュリティが既に構成されています。これらのグループは、社内のさまざまなチームを表す Databricks で既に作成されているユーザー グループに直接マッピングされます。外部データベースの各グループに対して新しいログイン資格情報が作成されました。Databricks ユーティリティ シークレット モジュールを使用して、これらの資格情報を Databricks ユーザーが利用できるようにします。外部データベースですべての資格情報が正しく構成され、Databricks でグループ メンバーシップが適切に構成されていると仮定すると、チームにこれらの資格情報を使用するための最小限のアクセス権限を付与する方法を説明しているのは、次のうちどれですか。
  • Databricks-Certified-Data-Engineer-Professional 試験問題 72

    ある企業は、従来のDatabricksジョブでAuto Loaderを使用して、外部ソースから半構造化JSONファイルを処理しています。時折、重要なフィールドがnullであったり、型が無効であったり、予期しないネストされたスキーマのバリエーションを含むレコードが到着することがあります。エンジニアは、不正な形式または規格に準拠していないレコードが黙って破棄されることなく、別の隔離テーブルに捕捉されるようにする必要があります。パイプラインは、ジョブを失敗させることなく、正常なレコードをBronzeレイヤーに処理し続ける必要があり、このアプローチはバッチ処理とストリーミング処理の両方の取り込みをサポートする必要があります。
    データエンジニアは、不良レコードを自動的に隔離用のデルタテーブルにルーティングしつつ、良質なレコードは後続処理のためにブロンズ層に取り込む、堅牢なデータ取り込みパターンを構築する必要があります。
    この取り込みアーキテクチャにおいて、隔離メカニズムを満たすのはどの方法でしょうか?
  • Databricks-Certified-Data-Engineer-Professional 試験問題 73

    分散したデータアナリストチームが、オートスケーリングが構成されたインタラクティブなクラスタ上でコンピューティングリソースを共有しています。ワークスペース管理者は、コストとクエリのスループットをより適切に管理するために、クラスタのスケールアップが多数の同時ユーザーによるものか、リソースを大量に消費するクエリによるものかを評価したいと考えています。
    クラスターサイズ変更イベントのタイムラインはどこで確認できますか?
  • Databricks-Certified-Data-Engineer-Professional 試験問題 74

    データエンジニアリングチームは、顧客からのデータ削除依頼(忘れられること)を処理するジョブを設定しました。削除が必要なすべてのユーザーデータは、デフォルトのテーブル設定を使用してDelta Lakeテーブルに保存されています。
    チームは、前週のすべての削除処理を毎週日曜日の午前1時にバッチジョブとして実行することに決定しました。このジョブの実行時間は1時間未満です。毎週月曜日の午前3時には、組織全体のDelta Lakeテーブルに対して一連のVACUUMコマンドを実行するバッチジョブが実行されます。
    コンプライアンス担当者は最近、デルタレイクのタイムトラベル機能について知りました。担当者は、この機能によって削除されたデータへのアクセスが継続される可能性があることを懸念しています。
    削除ロジックがすべて正しく実装されていると仮定した場合、この懸念事項に正しく対処しているのはどの記述でしょうか?
  • Databricks-Certified-Data-Engineer-Professional 試験問題 75

    データ エンジニアは、最新の DBR バージョンを持つクラスタを使用して、銀行取引データを保存するための日次バッチ取り込みパイプラインを作成し、prod.gold.all_banking_transactions_daily という MANAGED DELTA テーブルに永続化しました。このテーブルを SQL Serverless Warehouse 経由でアドホックにクエリするビジネス ユーザーから、クエリ パフォーマンスが低いという苦情が絶えず寄せられています。分析の結果、データ エンジニアは、これらのユーザーがフィルタとして高カーディナリティの列を頻繁に使用していることを突き止めました。エンジニアは、段階的に実行でき、保守が容易で、時間の経過とともに進化できるデータ レイアウト最適化手法を実装しようとしています。データ エンジニアはどのコマンドを実装すべきでしょうか。