Professional-Data-Engineer 試験問題 191

Dataflow SDKは最近、どのApacheサービスに移行されましたか?
  • Professional-Data-Engineer 試験問題 192

    テーブルをBigQueryに移行し、データモデルを処理しています。テーブルには、複数の店舗で行われた購入に関連する情報が格納され、トランザクションの時間、購入したアイテム、店舗ID、店舗が所在する都市と州などの情報が含まれます。このテーブルを頻繁にクエリして、それぞれの数を確認します。過去30日間に販売された商品で、州の都市や個々の店舗ごとの購入傾向を確認します。このテーブルをモデル化して、クエリの時間とコストを最小限に抑えます。あなたは何をするべきか?
  • Professional-Data-Engineer 試験問題 193

    メディアストリーミングサービスであるモバイルアプリケーション用の新しいストレージシステムを展開しています。最適なのはGoogleCloudDatastoreです。複数のプロパティを持つエンティティがあり、そのうちのいくつかは複数の値を取ることができます。たとえば、エンティティ'Movie'のプロパティ'actors'とプロパティ'tags'には複数の値がありますが、プロパティ'datereleased'にはありません。一般的なクエリでは、actor = <actorname> orderedbydate_releasedorのすべての映画とtag=Comedyorderedbydate_releasedのすべての映画を要求します。インデックスの数の組み合わせ爆発をどのように回避する必要がありますか?
  • Professional-Data-Engineer 試験問題 194

    フローロジスティックケーススタディ
    会社概要
    Flowlogisticは、主要なロジスティクスおよびサプライチェーンプロバイダーです。これらは、世界中の企業がリソースを管理し、最終目的地に輸送するのに役立ちます。同社は急速に成長し、鉄道、トラック、航空機、および海上輸送を含むように提供を拡大しています。
    会社背景
    同社は地域のトラック会社としてスタートし、その後他のロジスティクス市場に拡大しました。
    インフラストラクチャを更新していないため、注文と出荷の管理と追跡がボトルネックになっています。運用を改善するために、Flowlogisticは、小包レベルでリアルタイムに貨物を追跡するための独自のテクノロジーを開発しました。ただし、Apache Kafkaに基づくテクノロジースタックが処理ボリュームをサポートできないため、デプロイできません。さらに、Flowlogisticは、注文と出荷をさらに分析して、リソースを最適に展開する方法を決定したいと考えています。
    ソリューションコンセプト
    Flowlogisticは、クラウドを使用して2つの概念を実装したいと考えています。
    独自の技術をリアルタイムの在庫追跡システムで使用して、

    それらの負荷
    構造化と非構造化の両方を含むすべての注文と出荷ログの分析を実行します

    データ、リソースを展開する最善の方法、情報を拡張する市場を決定するため。また、予測分析を使用して、出荷が遅れる時期を早期に学習したいと考えています。
    既存の技術環境
    フローロジスティックアーキテクチャは、単一のデータセンターに存在します。
    データベース

    2つのクラスターに8台の物理サーバー
    -SQL Server-ユーザーデータ、インベントリ、静的データ
    3台の物理サーバー
    -Cassandra-メタデータ、追跡メッセージ
    10台のKafkaサーバー-メッセージ集約とバッチ挿入の追跡
    アプリケーションサーバー-顧客フロントエンド、注文/税関用ミドルウェア

    20台の物理サーバーにまたがる60台の仮想マシン
    -Tomcat-Javaサービス
    -Nginx-静的コンテンツ
    -バッチサーバー
    ストレージアプライアンス

    -仮想マシン(VM)ホスト用のiSCSI
    -ファイバーチャネルストレージエリアネットワーク(FC SAN)-SQLサーバーストレージ
    -ネットワーク接続ストレージ(NAS)イメージストレージ、ログ、バックアップ
    10個のApacheHadoop/Sparkサーバー

    -コアデータレイク
    -データ分析のワークロード
    その他のサーバー20台

    -ジェンキンス、監視、要塞ホスト、
    ビジネス要件
    生産のスケーリングされたパンティーで信頼性と再現性のある環境を構築します。

    分析のために一元化されたデータレイクにデータを集約する

    履歴データを使用して、将来の出荷に関する予測分析を実行します

    独自の技術を使用して、世界中のすべての貨物を正確に追跡します

    新しいリソースの迅速なプロビジョニングを通じて、ビジネスの俊敏性とイノベーションのスピードを向上させます

    クラウドでのパフォーマンスのためにアーキテクチャを分析および最適化する

    他のすべての要件が満たされている場合は、クラウドに完全に移行します

    技術要件
    ストリーミングデータとバッチデータの両方を処理する

    既存のHadoopワークロードを移行する

    会社の変化する要求を満たすために、アーキテクチャがスケーラブルで弾力性があることを確認します。

    可能な限りマネージドサービスを使用する

    データの飛行と静止を暗号化する

    本番データセンターとクラウド環境の間にVPNを接続します

    SEOステートメント
    私たちは急速に成長したため、インフラストラクチャをアップグレードできないことが、さらなる成長と効率を実際に妨げています。私たちは世界中の貨物を移動するのに効率的ですが、データを移動するのは非効率的です。
    顧客がどこにいて、何を出荷しているのかをより簡単に理解できるように、情報を整理する必要があります。
    CTOステートメント
    ITは私たちにとって優先事項ではなかったため、データが増大するにつれて、テクノロジーに十分な投資をしていません。私にはITを管理する優れたスタッフがいますが、彼らはインフラストラクチャの管理に忙しく、データの整理、分析の構築、CFOの実装方法の理解などの本当に重要なことを彼らに行わせることができません。追跡技術。
    CFOステートメント
    私たちの競争上の利点の一部は、遅れた出荷と配達に対して自分自身にペナルティを課すことです。出荷が常にどこにあるかを知ることは、私たちの収益と収益性に直接的な相関関係があります。
    さらに、サーバー環境の構築に資金を投入したくありません。
    Flowlogisticは、リアルタイムの在庫追跡システムを展開しています。追跡デバイスはすべてパッケージ追跡メッセージを送信します。このメッセージは、ApacheKafkaクラスターではなく単一のGoogleCloud Pub/Subトピックに送信されます。サブスクライバーアプリケーションは、リアルタイムレポート用にメッセージを処理し、履歴分析のためにGoogleBigQueryに保存します。パッケージデータを長期にわたって分析できるようにする必要があります。
    どのアプローチを取るべきですか?
  • Professional-Data-Engineer 試験問題 195

    Cloud Bigtableは、非常に大量の____________________________を保存するための推奨オプションです。