Professional-Data-Engineer 試験問題 36
次のどれがハイパーパラメータの例ですか? (回答を 2 つ選択してください。)
Professional-Data-Engineer 試験問題 37
既存のオンプレミス データ戦略を最新化する必要があります。組織で現在使用しているもの。
* データ複製用のオンプレミス Hadoop 分散ファイル システム (HDFS) を含む、複数の大規模データ セットを処理するための Apache Hadoop クラスター。
* Apache Airflow は、数千のジョブ ステップで数百の ETL パイプラインをオーケストレーションします。
Hadoop ワークロードを処理でき、既存のオーケストレーション プロセスへの変更を最小限に抑えることができる新しいアーキテクチャを Google Cloud にセットアップする必要があります。どうすればよいでしょうか。
* データ複製用のオンプレミス Hadoop 分散ファイル システム (HDFS) を含む、複数の大規模データ セットを処理するための Apache Hadoop クラスター。
* Apache Airflow は、数千のジョブ ステップで数百の ETL パイプラインをオーケストレーションします。
Hadoop ワークロードを処理でき、既存のオーケストレーション プロセスへの変更を最小限に抑えることができる新しいアーキテクチャを Google Cloud にセットアップする必要があります。どうすればよいでしょうか。
Professional-Data-Engineer 試験問題 38
仮想プライベート クラウド (VPC) ネットワークの一部として VM に Oracle データベースをデプロイしています。50 個のテーブルを BigQuery に複製し、継続的に同期したいと考えています。インフラストラクチャを管理する必要性を最小限に抑えたいと考えています。どうすればよいでしょうか。
Professional-Data-Engineer 試験問題 39
Cloud Dataflow でパイプラインを実行して、Cloud Pub/Sub トピックからメッセージを受信し、その結果を EU の BigQuery データセットに書き込みます。現在、パイプラインは europe-west4 にあり、最大 3 つのワーカー、インスタンス タイプ n1-standard-1 があります。ピーク時には、3 つのワーカーすべてが CPU 使用率を最大にするため、パイプラインがレコードをタイムリーに処理するのに苦労していることに気付きました。パイプラインのパフォーマンスを向上させるために実行できるアクションはどれですか (2 つ選択してください)。
Professional-Data-Engineer 試験問題 40
MJTelco のケーススタディ
会社概要
MJTelco は、世界中で急成長しているがサービスが行き届いていない市場にネットワークを構築することを計画しているスタートアップ企業です。同社は革新的な光通信ハードウェアの特許を保有しています。これらの特許に基づいて、同社は安価なハードウェアで信頼性の高い高速バックボーン リンクを多数構築できます。
会社概要
経験豊富な通信会社の幹部によって設立された MJTelco は、宇宙での通信の課題を克服するために開発されたテクノロジーを使用しています。同社の業務の基盤となるのは、リアルタイム分析を推進し、機械学習を組み込んでトポロジを継続的に最適化する分散データ インフラストラクチャを作成することです。ハードウェアは安価であるため、同社はネットワークを過剰に展開して、地域政治の変動が場所の可用性とコストに与える影響を考慮に入れることを計画しています。
同社の管理および運用チームは世界中に配置されており、システム内のデータ コンシューマーとデータ提供者の間に多対多の関係を構築しています。慎重に検討した結果、パブリック クラウドがニーズをサポートするのに最適な環境であると判断しました。
ソリューションコンセプト
MJTelco は、自社のラボで概念実証 (PoC) プロジェクトを成功させています。同社には主に 2 つのニーズがあります。
より多くのデータフローが生成される場合に、PoCを拡張して強化することで、

50,000 以上のインストール。
機械学習サイクルを改良して、制御に使用する動的モデルを検証し、改善する

トポロジの定義。
MJTelcoは、開発/テスト、ステージング、本番の3つの独立した運用環境も使用します。
- 実験の実行、新機能の導入、実稼働顧客へのサービス提供のニーズを満たすため。
ビジネス要件
最小限のコストで生産環境を拡張し、いつでもどこでもリソースをインスタンス化します。

予測不可能な分散型通信ユーザーコミュニティで必要とされます。
最先端の機械学習と分析を保護するために、独自データのセキュリティを確保します。

分散した研究員に分析用のデータへの信頼性とタイムリーなアクセスを提供する

機械学習モデルの迅速な反復をサポートする隔離された環境を維持する

顧客に影響を与えます。
技術要件
テレメトリデータの安全かつ効率的な転送と保存を確保する
インスタンスを迅速に拡張して、それぞれ複数のフローを持つ 10,000 ~ 100,000 のデータ プロバイダーをサポートします。
約2年分のデータを追跡するデータテーブルに対する分析とプレゼンテーションを可能にします。
1日あたり1億件のレコード
テレメトリ フローと実稼働学習サイクルの両方でのデータ パイプラインの問題を認識することに重点を置いた監視インフラストラクチャの迅速な反復をサポートします。
CEOの声明
当社のビジネス モデルは、特許、分析、動的機械学習に依存しています。当社の安価なハードウェアは信頼性が高くなるように構成されており、コスト面で有利です。信頼性と容量のコミットメントを満たすには、大規模な分散データ パイプラインを迅速に安定化する必要があります。
CTO 声明
当社のパブリック クラウド サービスは、宣伝どおりに機能する必要があります。拡張可能で、データを安全に保つリソースが必要です。また、データ サイエンティストがモデルを慎重に研究し、迅速に適応できる環境も必要です。当社はデータの処理を自動化に依存しているため、反復しながら機能する開発環境とテスト環境も必要です。
CFOの声明
プロジェクトが大きすぎるため、データと分析に必要なハードウェアとソフトウェアを維持することはできません。
また、膨大なデータ フィードを監視するために運用チームを配置する余裕はないため、自動化とインフラストラクチャに頼ることになります。Google Cloud の機械学習により、当社の定量研究者はデータ パイプラインの問題ではなく、価値の高い問題に取り組むことができます。
次の要件を満たす運用チーム向けの視覚化を作成する必要があります。
テレメトリには、過去6週間の50,000件のインストールすべてからのデータを含める必要があります(1回サンプリング)。

毎分
レポートはライブデータから 3 時間以上遅延してはなりません。

実用的なレポートには、最適ではないリンクのみが表示されます。

最適ではないリンクのほとんどは、一番上に並べる必要があります。

最適ではないリンクは、地域別にグループ化してフィルタリングできます。

レポートをロードするためのユーザー応答時間は 5 秒未満である必要があります。

過去 6 週間のデータを保存するデータ ソースを作成し、複数の日付範囲、異なる地理的地域、固有のインストール タイプを閲覧者が確認できる視覚化を作成します。視覚化に変更を加えることなく、常に最新のデータを表示します。毎月新しい視覚化を作成して更新することは避けたいと考えています。どうすればよいでしょうか。
会社概要
MJTelco は、世界中で急成長しているがサービスが行き届いていない市場にネットワークを構築することを計画しているスタートアップ企業です。同社は革新的な光通信ハードウェアの特許を保有しています。これらの特許に基づいて、同社は安価なハードウェアで信頼性の高い高速バックボーン リンクを多数構築できます。
会社概要
経験豊富な通信会社の幹部によって設立された MJTelco は、宇宙での通信の課題を克服するために開発されたテクノロジーを使用しています。同社の業務の基盤となるのは、リアルタイム分析を推進し、機械学習を組み込んでトポロジを継続的に最適化する分散データ インフラストラクチャを作成することです。ハードウェアは安価であるため、同社はネットワークを過剰に展開して、地域政治の変動が場所の可用性とコストに与える影響を考慮に入れることを計画しています。
同社の管理および運用チームは世界中に配置されており、システム内のデータ コンシューマーとデータ提供者の間に多対多の関係を構築しています。慎重に検討した結果、パブリック クラウドがニーズをサポートするのに最適な環境であると判断しました。
ソリューションコンセプト
MJTelco は、自社のラボで概念実証 (PoC) プロジェクトを成功させています。同社には主に 2 つのニーズがあります。
より多くのデータフローが生成される場合に、PoCを拡張して強化することで、

50,000 以上のインストール。
機械学習サイクルを改良して、制御に使用する動的モデルを検証し、改善する

トポロジの定義。
MJTelcoは、開発/テスト、ステージング、本番の3つの独立した運用環境も使用します。
- 実験の実行、新機能の導入、実稼働顧客へのサービス提供のニーズを満たすため。
ビジネス要件
最小限のコストで生産環境を拡張し、いつでもどこでもリソースをインスタンス化します。

予測不可能な分散型通信ユーザーコミュニティで必要とされます。
最先端の機械学習と分析を保護するために、独自データのセキュリティを確保します。

分散した研究員に分析用のデータへの信頼性とタイムリーなアクセスを提供する

機械学習モデルの迅速な反復をサポートする隔離された環境を維持する

顧客に影響を与えます。
技術要件
テレメトリデータの安全かつ効率的な転送と保存を確保する
インスタンスを迅速に拡張して、それぞれ複数のフローを持つ 10,000 ~ 100,000 のデータ プロバイダーをサポートします。
約2年分のデータを追跡するデータテーブルに対する分析とプレゼンテーションを可能にします。
1日あたり1億件のレコード
テレメトリ フローと実稼働学習サイクルの両方でのデータ パイプラインの問題を認識することに重点を置いた監視インフラストラクチャの迅速な反復をサポートします。
CEOの声明
当社のビジネス モデルは、特許、分析、動的機械学習に依存しています。当社の安価なハードウェアは信頼性が高くなるように構成されており、コスト面で有利です。信頼性と容量のコミットメントを満たすには、大規模な分散データ パイプラインを迅速に安定化する必要があります。
CTO 声明
当社のパブリック クラウド サービスは、宣伝どおりに機能する必要があります。拡張可能で、データを安全に保つリソースが必要です。また、データ サイエンティストがモデルを慎重に研究し、迅速に適応できる環境も必要です。当社はデータの処理を自動化に依存しているため、反復しながら機能する開発環境とテスト環境も必要です。
CFOの声明
プロジェクトが大きすぎるため、データと分析に必要なハードウェアとソフトウェアを維持することはできません。
また、膨大なデータ フィードを監視するために運用チームを配置する余裕はないため、自動化とインフラストラクチャに頼ることになります。Google Cloud の機械学習により、当社の定量研究者はデータ パイプラインの問題ではなく、価値の高い問題に取り組むことができます。
次の要件を満たす運用チーム向けの視覚化を作成する必要があります。
テレメトリには、過去6週間の50,000件のインストールすべてからのデータを含める必要があります(1回サンプリング)。

毎分
レポートはライブデータから 3 時間以上遅延してはなりません。

実用的なレポートには、最適ではないリンクのみが表示されます。

最適ではないリンクのほとんどは、一番上に並べる必要があります。

最適ではないリンクは、地域別にグループ化してフィルタリングできます。

レポートをロードするためのユーザー応答時間は 5 秒未満である必要があります。

過去 6 週間のデータを保存するデータ ソースを作成し、複数の日付範囲、異なる地理的地域、固有のインストール タイプを閲覧者が確認できる視覚化を作成します。視覚化に変更を加えることなく、常に最新のデータを表示します。毎月新しい視覚化を作成して更新することは避けたいと考えています。どうすればよいでしょうか。

