Professional-Data-Engineer 試験問題 236

機械学習データセットをトレーニング データとテスト データに分割する必要があるのはなぜですか?
  • Professional-Data-Engineer 試験問題 237

    組織が GCP の使用を拡大するにつれて、多くのチームが独自のプロジェクトを作成し始めています。導入のさまざまな段階や対象ユーザーに対応するために、プロジェクトはさらに複数化されます。各プロジェクトには固有のアクセス制御構成が必要です。中央の IT チームはすべてのプロジェクトにアクセスできる必要があります。さらに、Cloud Storage バケットと BigQuery データセットのデータは、他のプロジェクトで使用するためにアドホックな方法で共有する必要があります。ポリシーの数を最小限に抑えて、アクセス制御管理を簡素化したいと考えています。どの 2 つのステップを実行する必要がありますか? 答えを 2 つ選択してください。
  • Professional-Data-Engineer 試験問題 238

    あなたは、衣服を推奨するためのモデルを構築しています。ユーザーのファッションの好みは時間の経過とともに変化する可能性が高いことがわかっているため、新しいデータが利用可能になったときにモデルにストリーミングして戻すデータ パイプラインを構築します。モデルをトレーニングするためにこのデータをどのように使用する必要がありますか?
  • Professional-Data-Engineer 試験問題 239

    Flowlogistic の CEO は、顧客ベースに関する洞察を迅速に得て、営業チームが現場でより良い情報を得ることができるようにしたいと考えています。このチームは技術に詳しくないため、BigQuery レポートの作成を簡素化するために視覚化ツールを購入しました。しかし、テーブル内のすべてのデータに圧倒されており、必要なデータを見つけるためにクエリに多額の費用を費やしています。最もコスト効率の高い方法で問題を解決したいと考えています。あなたは何をするべきか?
  • Professional-Data-Engineer 試験問題 240

    多数の連続した読み込みジョブと変換ジョブをスケジュールしたい場合 データ ファイルは上流プロセスによって Cloud Storage バケットに追加されます 新しいデータがいつ到着するかについての固定スケジュールはありません 次に、Dataproc ジョブがトリガーされ、いくつかの変換と書き込みが実行されますデータを BigQuery に送信します。次に、BigQuery で追加の変換ジョブを実行する必要があります。 変換ジョブはテーブルごとに異なります。 これらのジョブは完了するまでに数時間かかる場合があります。 数百のテーブルを処理し、最新のデータをエンドユーザーに提供するには、最も効率的で保守可能なワークフローを決定する必要があります。あなたは何をするべきか?