Professional-Data-Engineer 試験問題 46

ビジネスユーザーは、分析に使用する前にデータをクレンジングし、準備する方法を必要としています。ビジネスユーザーは技術にあまり精通しておらず、グラフィカルユーザーインターフェースを使って変換を定義することを好みます。データ変換後、ビジネスユーザーはスプレッドシートで直接分析を実行したいと考えています。あなたは、彼らが使用できるソリューションを推奨する必要があります。どうすればよいでしょうか?
  • Professional-Data-Engineer 試験問題 47

    分析用に10PBの製品履歴データを提供するアプリケーションのデータバックエンドを移行しました。製品の最新の状態(約10GBのデータ)のみをAPI経由で他のアプリケーションに提供する必要があります。分析要件に対応し、1秒あたり最大1000クエリ(QPS)、レイテンシ1秒未満のAPIパフォーマンスを備えた、費用対効果の高い永続ストレージソリューションを選択する必要があります。どうすればよいでしょうか?
  • Professional-Data-Engineer 試験問題 48

    現在、貴社ではキャンペーン用のデータパイプラインを構築中です。Google Cloud Pub/Sub のすべての
    ストリーミングデータを扱う上で、キャンペーン中に定期的に入力とそのタイミングを特定できることは重要なビジネス要件の一つです。エンジニアたちは、この目的のためにGoogle Cloud Dataflowのウィンドウ処理と変換を使用することにしました。しかし、この機能をテストしたところ、Cloud Dataflowジョブがすべてのストリーミング挿入で失敗することがわかりました。この問題の最も可能性の高い原因は何でしょうか?
  • Professional-Data-Engineer 試験問題 49

    ある運送会社では、リアルタイムでApache Kafkaストリームに送信される荷物追跡データを保有しています。このデータはその後、BigQueryに読み込まれます。社内のアナリストは、荷物のライフサイクルにおける地理空間の傾向を分析するために、BigQueryで追跡データをクエリしたいと考えています。テーブルは元々、取り込み日によるパーティショニングで作成されていましたが、時間の経過とともにクエリ処理時間が増加しています。BigQueryのクエリパフォーマンスを向上させる変更を実装する必要があります。どうすればよいでしょうか?
  • Professional-Data-Engineer 試験問題 50

    あなたの会社では、Google Cloud Dataflow で学習アルゴリズムのデータ前処理を実行しています。
    このステップでは多数のデータ ログが生成されるため、チームはそれらを分析したいと考えています。
    キャンペーンの動的な性質により、データは毎時間指数関数的に増加しています。データサイエンティストは、ログ内の新たな主要な特徴をデータから読み取るために、以下のコードを作成しました。
    BigQueryIO.読み取り
    .named("ログデータ読み取り")
    .from("clouddataflow-readonly:samples.log_data")
    このデータ読み取りのパフォーマンスを改善したいのですが、どうすればよいでしょうか?