
Google Certified Professional Data Engineer Exam (Professional-Data-Engineer日本語版) - Professional-Data-Engineer日本語 Exam Questions
QUESTION NO: 1
BigQuery ML を使用して不正検出モデルを開発しています。生のトランザクションデータセットがあり、average_transaction_amount_last_24_hours や time_since_last_transaction などの新しい特徴量を作成する必要があります。これらの特徴量を作成するには、既存のデータに対して集計と時間ウィンドウ計算を行う必要があります。目標は、手動による介入なしに、モデルのトレーニングと予測の両方でこれらの特徴量が一貫して適用されるようにすることです。モデル用にこれらの特徴量を効率的に準備する必要があります。どうすればよいですか?
BigQuery ML を使用して不正検出モデルを開発しています。生のトランザクションデータセットがあり、average_transaction_amount_last_24_hours や time_since_last_transaction などの新しい特徴量を作成する必要があります。これらの特徴量を作成するには、既存のデータに対して集計と時間ウィンドウ計算を行う必要があります。目標は、手動による介入なしに、モデルのトレーニングと予測の両方でこれらの特徴量が一貫して適用されるようにすることです。モデル用にこれらの特徴量を効率的に準備する必要があります。どうすればよいですか?
Correct Answer: B
Explanation: Only visible for Pass4Test members. You can sign-up / login (it's free).
QUESTION NO: 2
あなたはデータウェアハウスとしてGoogle BigQueryを使用しています。ユーザーから、以下の単純なクエリが、実行時間に関わらず非常に遅いという報告を受けています。
SELECT country, state, city FROM [myproject:mydataset.mytable] GROUP BY country クエリのクエリ プランを確認すると、ステージ 1 の Read セクションに次の出力が表示されます。

このクエリの遅延の最も可能性の高い原因は何ですか?
あなたはデータウェアハウスとしてGoogle BigQueryを使用しています。ユーザーから、以下の単純なクエリが、実行時間に関わらず非常に遅いという報告を受けています。
SELECT country, state, city FROM [myproject:mydataset.mytable] GROUP BY country クエリのクエリ プランを確認すると、ステージ 1 の Read セクションに次の出力が表示されます。

このクエリの遅延の最も可能性の高い原因は何ですか?
Correct Answer: B
QUESTION NO: 3
あなたは物流会社を経営しており、車両ベースのセンサーのイベント配信の信頼性を向上したいと考えています。これらのイベントをキャプチャするために世界中で小規模なデータ センターを運営していますが、イベント収集インフラストラクチャからイベント処理インフラストラクチャへの接続を提供する専用回線は信頼性が低く、遅延が予測できません。この問題を最もコスト効率の良い方法で解決したいと考えています。どうすればよいでしょうか。
あなたは物流会社を経営しており、車両ベースのセンサーのイベント配信の信頼性を向上したいと考えています。これらのイベントをキャプチャするために世界中で小規模なデータ センターを運営していますが、イベント収集インフラストラクチャからイベント処理インフラストラクチャへの接続を提供する専用回線は信頼性が低く、遅延が予測できません。この問題を最もコスト効率の良い方法で解決したいと考えています。どうすればよいでしょうか。
Correct Answer: D
Explanation: Only visible for Pass4Test members. You can sign-up / login (it's free).
QUESTION NO: 4
分析用に10PBの製品履歴データを提供するアプリケーションのデータバックエンドを移行しました。製品の最新の状態(約10GBのデータ)のみをAPI経由で他のアプリケーションに提供する必要があります。分析要件と、1秒未満のレイテンシで最大1000クエリ/秒(QPS)のAPIパフォーマンスに対応できる、コスト効率の高い永続ストレージソリューションを選択する必要があります。どうすればよいでしょうか?
分析用に10PBの製品履歴データを提供するアプリケーションのデータバックエンドを移行しました。製品の最新の状態(約10GBのデータ)のみをAPI経由で他のアプリケーションに提供する必要があります。分析要件と、1秒未満のレイテンシで最大1000クエリ/秒(QPS)のAPIパフォーマンスに対応できる、コスト効率の高い永続ストレージソリューションを選択する必要があります。どうすればよいでしょうか?
Correct Answer: A
QUESTION NO: 5
あなたは、Lookerなどのツールでアドホッククエリや下流レポートを実行するデータ利用者チームをサポートするBigQuery管理者です。すべてのデータとユーザーは、単一の組織プロジェクトに統合されています。最近、クエリ結果の処理速度が遅くなっていることに気づき、その原因を特定したいと考えています。ユーザーがジョブを実行する際に、ジョブキューイングやスロット競合が発生し、結果へのアクセスが遅くなっている可能性があると考えています。クエリジョブ情報を調査し、パフォーマンスに影響が出ている箇所を特定する必要があります。どうすればよいですか?
あなたは、Lookerなどのツールでアドホッククエリや下流レポートを実行するデータ利用者チームをサポートするBigQuery管理者です。すべてのデータとユーザーは、単一の組織プロジェクトに統合されています。最近、クエリ結果の処理速度が遅くなっていることに気づき、その原因を特定したいと考えています。ユーザーがジョブを実行する際に、ジョブキューイングやスロット競合が発生し、結果へのアクセスが遅くなっている可能性があると考えています。クエリジョブ情報を調査し、パフォーマンスに影響が出ている箇所を特定する必要があります。どうすればよいですか?
Correct Answer: A
QUESTION NO: 6
ケーススタディ1 - Flowlogistic
会社概要
Flowlogisticは、物流およびサプライチェーン分野におけるリーディングプロバイダーです。世界中の企業が資源を管理し、最終目的地まで輸送できるよう支援しています。同社は急速に成長を遂げ、鉄道、トラック、航空機、海上輸送など、サービス提供範囲を拡大しています。
会社概要
同社は地域密着型のトラック運送会社として創業し、その後、他の物流市場へと事業を拡大しました。しかし、インフラの更新が遅れたため、注文や出荷の管理・追跡がボトルネックとなっていました。業務改善のため、Flowlogisticは小包レベルでリアルタイムに出荷を追跡する独自の技術を開発しました。しかし、Apache Kafkaをベースとした既存の技術スタックでは処理量に対応できないため、この技術を導入することができませんでした。さらに、Flowlogisticは注文と出荷に関する詳細な分析を行い、最適なリソース配分方法を検討したいと考えています。
解決策のコンセプト
Flowlogisticはクラウドを使用して2つのコンセプトを実現したいと考えています。
* 自社独自の技術を活用したリアルタイム在庫追跡システムにより、積荷の位置をリアルタイムで表示する。
* 構造化データと非構造化データの両方を含むすべての注文と出荷ログの分析を実行して、リソースを最適に展開する方法、情報を拡大する市場を決定します。
彼らはまた、予測分析を用いて、出荷の遅延が発生する時期をより早く把握したいと考えている。
既存の技術環境
Flowlogisticアーキテクチャは単一のデータセンターに存在します。
* データベース
2つのクラスターに8台の物理サーバーを配置
- SQL Server - ユーザーデータ、在庫、静的データ
物理サーバー3台
- Cassandra - メタデータ、メッセージの追跡
10台のKafkaサーバー - メッセージ集約とバッチ挿入の追跡
* アプリケーションサーバー - 顧客向けフロントエンド、注文/税関向けミドルウェア
20台の物理サーバーに分散された60台の仮想マシン
- Tomcat - Javaサービス
- Nginx - 静的コンテンツ
- バッチサーバー
* 収納機器
- 仮想マシン(VM)ホスト向けiSCSI
- ファイバーチャネルストレージエリアネットワーク(FC SAN) - SQLサーバーストレージ
- ネットワーク接続ストレージ(NAS)のイメージストレージ、ログ、バックアップ
* Apache Hadoop/Sparkサーバー10台
- コアデータレイク
- データ分析の作業負荷
* その他サーバー20台
- Jenkins、監視、バスティオンホスト、
ビジネス要件
* 拡張可能な生産環境を備え、信頼性が高く再現性のある環境を構築する。
分析のためにデータを一元化されたデータレイクに集約する
* 過去のデータを使用して、将来の出荷に関する予測分析を実行します。
独自の技術を用いて、世界中のすべての貨物を正確に追跡します。
* 新しいリソースを迅速に提供することで、ビジネスの俊敏性とイノベーションのスピードを向上させる
クラウドにおけるパフォーマンスを考慮したアーキテクチャの分析と最適化
* 他のすべての要件を満たしている場合は、クラウドに完全移行する
技術要件
ストリーミングデータとバッチデータの両方を処理する
* 既存のHadoopワークロードを移行する
* 会社の変化するニーズに対応できるよう、アーキテクチャが拡張性と柔軟性を備えていることを確認する。
可能な限りマネージドサービスを利用する
* データの転送時および保存時の暗号化
* 本番データセンターとクラウド環境の間にVPNを接続する SEOステートメント 当社は急速に成長してきたため、インフラストラクチャをアップグレードできないことが、さらなる成長と効率性を阻害しています。当社は世界中に商品を輸送することには効率的ですが、データの移動には非効率的です。
顧客がどこにいて、何を発送しているのかをより簡単に把握できるように、情報を整理する必要があります。
CTO声明
ITはこれまで当社にとって優先事項ではなかったため、データ量の増加に伴い、テクノロジーへの投資が十分ではありませんでした。IT管理を担当する優秀なスタッフはいますが、彼らはインフラ管理に追われ、データの整理、分析ツールの構築、CFOの追跡テクノロジーの実装方法の検討といった、本当に重要な業務に時間を割くことができません。
最高財務責任者(CFO)声明
当社の競争優位性の一つは、出荷や納品の遅延に対して自らにペナルティを課している点です。
出荷状況の常時把握は、当社の収益と利益に直接影響します。さらに、サーバー環境の構築に資金を投入したくありません。
Flowlogistic はリアルタイム在庫追跡システムを展開しています。追跡デバイスはすべてパッケージ追跡メッセージを送信しますが、これらのメッセージは Apache Kafka クラスターではなく、単一の Google Cloud Pub/Sub トピックに送信されます。サブスクライバーアプリケーションは、リアルタイムレポート用にメッセージを処理して、履歴分析のために Google BigQuery に保存します。パッケージデータを時系列で分析できるようにしたい場合、どの方法を採用すべきでしょうか?
ケーススタディ1 - Flowlogistic
会社概要
Flowlogisticは、物流およびサプライチェーン分野におけるリーディングプロバイダーです。世界中の企業が資源を管理し、最終目的地まで輸送できるよう支援しています。同社は急速に成長を遂げ、鉄道、トラック、航空機、海上輸送など、サービス提供範囲を拡大しています。
会社概要
同社は地域密着型のトラック運送会社として創業し、その後、他の物流市場へと事業を拡大しました。しかし、インフラの更新が遅れたため、注文や出荷の管理・追跡がボトルネックとなっていました。業務改善のため、Flowlogisticは小包レベルでリアルタイムに出荷を追跡する独自の技術を開発しました。しかし、Apache Kafkaをベースとした既存の技術スタックでは処理量に対応できないため、この技術を導入することができませんでした。さらに、Flowlogisticは注文と出荷に関する詳細な分析を行い、最適なリソース配分方法を検討したいと考えています。
解決策のコンセプト
Flowlogisticはクラウドを使用して2つのコンセプトを実現したいと考えています。
* 自社独自の技術を活用したリアルタイム在庫追跡システムにより、積荷の位置をリアルタイムで表示する。
* 構造化データと非構造化データの両方を含むすべての注文と出荷ログの分析を実行して、リソースを最適に展開する方法、情報を拡大する市場を決定します。
彼らはまた、予測分析を用いて、出荷の遅延が発生する時期をより早く把握したいと考えている。
既存の技術環境
Flowlogisticアーキテクチャは単一のデータセンターに存在します。
* データベース
2つのクラスターに8台の物理サーバーを配置
- SQL Server - ユーザーデータ、在庫、静的データ
物理サーバー3台
- Cassandra - メタデータ、メッセージの追跡
10台のKafkaサーバー - メッセージ集約とバッチ挿入の追跡
* アプリケーションサーバー - 顧客向けフロントエンド、注文/税関向けミドルウェア
20台の物理サーバーに分散された60台の仮想マシン
- Tomcat - Javaサービス
- Nginx - 静的コンテンツ
- バッチサーバー
* 収納機器
- 仮想マシン(VM)ホスト向けiSCSI
- ファイバーチャネルストレージエリアネットワーク(FC SAN) - SQLサーバーストレージ
- ネットワーク接続ストレージ(NAS)のイメージストレージ、ログ、バックアップ
* Apache Hadoop/Sparkサーバー10台
- コアデータレイク
- データ分析の作業負荷
* その他サーバー20台
- Jenkins、監視、バスティオンホスト、
ビジネス要件
* 拡張可能な生産環境を備え、信頼性が高く再現性のある環境を構築する。
分析のためにデータを一元化されたデータレイクに集約する
* 過去のデータを使用して、将来の出荷に関する予測分析を実行します。
独自の技術を用いて、世界中のすべての貨物を正確に追跡します。
* 新しいリソースを迅速に提供することで、ビジネスの俊敏性とイノベーションのスピードを向上させる
クラウドにおけるパフォーマンスを考慮したアーキテクチャの分析と最適化
* 他のすべての要件を満たしている場合は、クラウドに完全移行する
技術要件
ストリーミングデータとバッチデータの両方を処理する
* 既存のHadoopワークロードを移行する
* 会社の変化するニーズに対応できるよう、アーキテクチャが拡張性と柔軟性を備えていることを確認する。
可能な限りマネージドサービスを利用する
* データの転送時および保存時の暗号化
* 本番データセンターとクラウド環境の間にVPNを接続する SEOステートメント 当社は急速に成長してきたため、インフラストラクチャをアップグレードできないことが、さらなる成長と効率性を阻害しています。当社は世界中に商品を輸送することには効率的ですが、データの移動には非効率的です。
顧客がどこにいて、何を発送しているのかをより簡単に把握できるように、情報を整理する必要があります。
CTO声明
ITはこれまで当社にとって優先事項ではなかったため、データ量の増加に伴い、テクノロジーへの投資が十分ではありませんでした。IT管理を担当する優秀なスタッフはいますが、彼らはインフラ管理に追われ、データの整理、分析ツールの構築、CFOの追跡テクノロジーの実装方法の検討といった、本当に重要な業務に時間を割くことができません。
最高財務責任者(CFO)声明
当社の競争優位性の一つは、出荷や納品の遅延に対して自らにペナルティを課している点です。
出荷状況の常時把握は、当社の収益と利益に直接影響します。さらに、サーバー環境の構築に資金を投入したくありません。
Flowlogistic はリアルタイム在庫追跡システムを展開しています。追跡デバイスはすべてパッケージ追跡メッセージを送信しますが、これらのメッセージは Apache Kafka クラスターではなく、単一の Google Cloud Pub/Sub トピックに送信されます。サブスクライバーアプリケーションは、リアルタイムレポート用にメッセージを処理して、履歴分析のために Google BigQuery に保存します。パッケージデータを時系列で分析できるようにしたい場合、どの方法を採用すべきでしょうか?
Correct Answer: B
QUESTION NO: 7
Cloud Dataproc は、マネージド Apache Hadoop および Apache _____ サービスです。
Cloud Dataproc は、マネージド Apache Hadoop および Apache _____ サービスです。
Correct Answer: B
Explanation: Only visible for Pass4Test members. You can sign-up / login (it's free).
QUESTION NO: 8
組織内の各分析チームは、独自のプロジェクトで BigQuery ジョブを実行しています。各チームがプロジェクト内のスロットの使用状況を監視できるようにしたいと考えています。どうすればよいでしょうか。
組織内の各分析チームは、独自のプロジェクトで BigQuery ジョブを実行しています。各チームがプロジェクト内のスロットの使用状況を監視できるようにしたいと考えています。どうすればよいでしょうか。
Correct Answer: C
Explanation: Only visible for Pass4Test members. You can sign-up / login (it's free).
QUESTION NO: 9
レガシー SQL と標準 SQL に関する次の記述のうち、正しくないものはどれですか。
レガシー SQL と標準 SQL に関する次の記述のうち、正しくないものはどれですか。
Correct Answer: A
Explanation: Only visible for Pass4Test members. You can sign-up / login (it's free).
QUESTION NO: 10
リアルタイム アプリケーションに Bigtable を使用しており、読み取りと書き込みが混在する大きな負荷があります。最近、追加のユース ケースを特定し、データベース全体の特定の統計を計算する分析ジョブを 1 時間ごとに実行する必要があります。運用アプリケーションの信頼性と分析ワークロードの両方を確保する必要があります。
何をすべきでしょうか?
リアルタイム アプリケーションに Bigtable を使用しており、読み取りと書き込みが混在する大きな負荷があります。最近、追加のユース ケースを特定し、データベース全体の特定の統計を計算する分析ジョブを 1 時間ごとに実行する必要があります。運用アプリケーションの信頼性と分析ワークロードの両方を確保する必要があります。
何をすべきでしょうか?
Correct Answer: C
QUESTION NO: 11
Google Cloud Bigtable は、各行に 1 つの値をインデックスします。この値は _______ と呼ばれます。
Google Cloud Bigtable は、各行に 1 つの値をインデックスします。この値は _______ と呼ばれます。
Correct Answer: A
Explanation: Only visible for Pass4Test members. You can sign-up / login (it's free).




