
Databricks Certified Professional Data Engineer Exam (Databricks-Certified-Professional-Data-Engineer Korean Version) - Databricks-Certified-Professional-Data-Engineer Korean Exam Questions
QUESTION NO: 1
데이터 엔지니어링 팀이 배포 자동화를 설정하고 있습니다. Databricks CLI 명령어를 사용하여 워크스페이스 자산을 원격으로 배포하려면 적절한 인증 설정을 구성해야 합니다.
어떤 인증 방식이 가장 높은 수준의 보안을 제공할까요?
데이터 엔지니어링 팀이 배포 자동화를 설정하고 있습니다. Databricks CLI 명령어를 사용하여 워크스페이스 자산을 원격으로 배포하려면 적절한 인증 설정을 구성해야 합니다.
어떤 인증 방식이 가장 높은 수준의 보안을 제공할까요?
Correct Answer: D
Explanation: Only visible for Pass4Test members. You can sign-up / login (it's free).
QUESTION NO: 2
주니어 데이터 엔지니어가 Databricks REST API 엔드포인트 2.0/jobs/create에 다음 JSON을 게시하는 워크로드를 구성했습니다.

모든 구성 및 참조된 리소스를 사용할 수 있다고 가정할 때, 이 워크로드를 세 번 실행했을 때의 결과를 설명하는 문장은 무엇입니까?
주니어 데이터 엔지니어가 Databricks REST API 엔드포인트 2.0/jobs/create에 다음 JSON을 게시하는 워크로드를 구성했습니다.

모든 구성 및 참조된 리소스를 사용할 수 있다고 가정할 때, 이 워크로드를 세 번 실행했을 때의 결과를 설명하는 문장은 무엇입니까?
Correct Answer: D
Explanation: Only visible for Pass4Test members. You can sign-up / login (it's free).
QUESTION NO: 3
상위 시스템에서 특정 데이터 배치에 대한 날짜를 매개변수로 Databricks Jobs API에 전달하도록 구성되었습니다. 예약된 노트북은 이 매개변수를 사용하여 다음 코드로 데이터를 로드합니다.
df = spark.read.format("parquet").load(f"/mnt/source/(date)")
위 코드 블록에서 사용된 날짜 파이썬 변수를 생성하려면 어떤 코드 블록을 사용해야 할까요?
상위 시스템에서 특정 데이터 배치에 대한 날짜를 매개변수로 Databricks Jobs API에 전달하도록 구성되었습니다. 예약된 노트북은 이 매개변수를 사용하여 다음 코드로 데이터를 로드합니다.
df = spark.read.format("parquet").load(f"/mnt/source/(date)")
위 코드 블록에서 사용된 날짜 파이썬 변수를 생성하려면 어떤 코드 블록을 사용해야 할까요?
Correct Answer: E
Explanation: Only visible for Pass4Test members. You can sign-up / login (it's free).
QUESTION NO: 4
DevOps 팀은 Jobs UI를 사용하여 매일 실행되도록 예약된 노트북 모음으로 프로덕션 워크로드를 구성했습니다. 새로 합류한 데이터 엔지니어가 프로덕션 로직을 검토하기 위해 이러한 노트북 중 하나에 대한 액세스 권한을 요청했습니다.
운영 중인 코드나 데이터가 실수로 변경되는 것을 방지하면서 사용자에게 부여할 수 있는 최대 노트북 권한은 얼마입니까?
DevOps 팀은 Jobs UI를 사용하여 매일 실행되도록 예약된 노트북 모음으로 프로덕션 워크로드를 구성했습니다. 새로 합류한 데이터 엔지니어가 프로덕션 로직을 검토하기 위해 이러한 노트북 중 하나에 대한 액세스 권한을 요청했습니다.
운영 중인 코드나 데이터가 실수로 변경되는 것을 방지하면서 사용자에게 부여할 수 있는 최대 노트북 권한은 얼마입니까?
Correct Answer: E
Explanation: Only visible for Pass4Test members. You can sign-up / login (it's free).
QUESTION NO: 5
분산된 데이터 분석가 팀이 자동 확장이 구성된 대화형 클러스터에서 컴퓨팅 리소스를 공유합니다. 워크스페이스 관리자는 비용과 쿼리 처리량을 더 효율적으로 관리하기 위해 클러스터 확장이 동시 사용자 수 증가 때문인지 아니면 리소스 집약적인 쿼리 때문인지 평가하고자 합니다.
클러스터 크기 조정 이벤트의 타임라인은 어디에서 확인할 수 있나요?
분산된 데이터 분석가 팀이 자동 확장이 구성된 대화형 클러스터에서 컴퓨팅 리소스를 공유합니다. 워크스페이스 관리자는 비용과 쿼리 처리량을 더 효율적으로 관리하기 위해 클러스터 확장이 동시 사용자 수 증가 때문인지 아니면 리소스 집약적인 쿼리 때문인지 평가하고자 합니다.
클러스터 크기 조정 이벤트의 타임라인은 어디에서 확인할 수 있나요?
Correct Answer: C
QUESTION NO: 6
데이터 엔지니어가 스트리밍 주문 데이터를 처리하기 위해 Lakeflow Spark 선언적 파이프라인을 설계하고 있습니다. 이 파이프라인은 Auto Loader를 사용하여 데이터를 수집하며, customer_id가 null이 아니고 amount가 0보다 큰지 확인하여 데이터 품질을 보장해야 합니다. 유효하지 않은 레코드는 삭제해야 합니다. Python을 사용하여 이 요구 사항을 구현하는 Lakeflow Spark 선언적 파이프라인 구성은 무엇일까요?
데이터 엔지니어가 스트리밍 주문 데이터를 처리하기 위해 Lakeflow Spark 선언적 파이프라인을 설계하고 있습니다. 이 파이프라인은 Auto Loader를 사용하여 데이터를 수집하며, customer_id가 null이 아니고 amount가 0보다 큰지 확인하여 데이터 품질을 보장해야 합니다. 유효하지 않은 레코드는 삭제해야 합니다. Python을 사용하여 이 요구 사항을 구현하는 Lakeflow Spark 선언적 파이프라인 구성은 무엇일까요?
Correct Answer: A
Explanation: Only visible for Pass4Test members. You can sign-up / login (it's free).
QUESTION NO: 7
데이터 팀이 배치 데이터와 스트리밍 데이터를 모두 처리하는 추가 전용 Delta Lake 파이프라인을 구현하고 있습니다. 이들은 소스 데이터의 스키마 변경 사항이 파이프라인을 중단시키지 않고 자동으로 반영되도록 하려고 합니다.
팀은 Delta 테이블에 데이터를 기록할 때 어떤 구성을 사용해야 할까요?
데이터 팀이 배치 데이터와 스트리밍 데이터를 모두 처리하는 추가 전용 Delta Lake 파이프라인을 구현하고 있습니다. 이들은 소스 데이터의 스키마 변경 사항이 파이프라인을 중단시키지 않고 자동으로 반영되도록 하려고 합니다.
팀은 Delta 테이블에 데이터를 기록할 때 어떤 구성을 사용해야 할까요?
Correct Answer: C
Explanation: Only visible for Pass4Test members. You can sign-up / login (it's free).
QUESTION NO: 8
쿼리 실행에 소요된 총 실제 시간을 측정하는 데 사용할 수 있는 방법은 무엇입니까?
쿼리 실행에 소요된 총 실제 시간을 측정하는 데 사용할 수 있는 방법은 무엇입니까?
Correct Answer: D
Explanation: Only visible for Pass4Test members. You can sign-up / login (it's free).
QUESTION NO: 9
데이터 엔지니어인 사용자 A는 REST API를 사용하여 여러 작업을 프로그래밍 방식으로 생성함으로써 새로운 파이프라인을 프로덕션 환경으로 배포했습니다. DevOps 엔지니어인 사용자 B는 외부 오케스트레이션 도구를 구성하여 REST API를 통해 작업 실행을 트리거하도록 설정했습니다. 두 사용자 모두 개인 액세스 토큰을 사용하여 REST API 호출을 승인했습니다.
다음 중 해당 이벤트와 관련된 작업 공간 감사 로그의 내용을 설명하는 문장은 무엇입니까?
데이터 엔지니어인 사용자 A는 REST API를 사용하여 여러 작업을 프로그래밍 방식으로 생성함으로써 새로운 파이프라인을 프로덕션 환경으로 배포했습니다. DevOps 엔지니어인 사용자 B는 외부 오케스트레이션 도구를 구성하여 REST API를 통해 작업 실행을 트리거하도록 설정했습니다. 두 사용자 모두 개인 액세스 토큰을 사용하여 REST API 호출을 승인했습니다.
다음 중 해당 이벤트와 관련된 작업 공간 감사 로그의 내용을 설명하는 문장은 무엇입니까?
Correct Answer: D
Explanation: Only visible for Pass4Test members. You can sign-up / login (it's free).
QUESTION NO: 10
Lakeflow 선언적 파이프라인의 운영 측면은 Spark 구조적 스트리밍과 어떻게 다른가요?
Lakeflow 선언적 파이프라인의 운영 측면은 Spark 구조적 스트리밍과 어떻게 다른가요?
Correct Answer: B
Explanation: Only visible for Pass4Test members. You can sign-up / login (it's free).
QUESTION NO: 11
데이터 엔지니어가 스트리밍 주문 데이터를 처리하기 위해 Lakeflow 선언적 파이프라인을 설계하고 있습니다. 이 파이프라인은 Auto Loader를 사용하여 데이터를 수집하며, customer_id와 amount 값이 0보다 큰지 확인하여 데이터 품질을 보장해야 합니다. 유효하지 않은 레코드는 삭제해야 합니다.
Lakeflow Declarative Pipelines 구성 중 어떤 구성이 Python을 사용하여 이 요구 사항을 구현합니까?
데이터 엔지니어가 스트리밍 주문 데이터를 처리하기 위해 Lakeflow 선언적 파이프라인을 설계하고 있습니다. 이 파이프라인은 Auto Loader를 사용하여 데이터를 수집하며, customer_id와 amount 값이 0보다 큰지 확인하여 데이터 품질을 보장해야 합니다. 유효하지 않은 레코드는 삭제해야 합니다.
Lakeflow Declarative Pipelines 구성 중 어떤 구성이 Python을 사용하여 이 요구 사항을 구현합니까?
Correct Answer: D
Explanation: Only visible for Pass4Test members. You can sign-up / login (it's free).
QUESTION NO: 12
데이터 엔지니어가 인터넷 연결이 끊긴 Databricks 환경에 PyYAML Python 패키지를 설치해야 합니다. 해당 워크스페이스는 PyPI에 직접 접근할 수 없습니다. 엔지니어는 .whl 파일을 로컬에 다운로드했으며, 새로 생성되는 모든 클러스터에서 해당 패키지를 자동으로 사용할 수 있도록 하고 싶어합니다.
데이터 엔지니어는 어떤 접근 방식을 사용해야 할까요?
데이터 엔지니어가 인터넷 연결이 끊긴 Databricks 환경에 PyYAML Python 패키지를 설치해야 합니다. 해당 워크스페이스는 PyPI에 직접 접근할 수 없습니다. 엔지니어는 .whl 파일을 로컬에 다운로드했으며, 새로 생성되는 모든 클러스터에서 해당 패키지를 자동으로 사용할 수 있도록 하고 싶어합니다.
데이터 엔지니어는 어떤 접근 방식을 사용해야 할까요?
Correct Answer: B
Explanation: Only visible for Pass4Test members. You can sign-up / login (it's free).
QUESTION NO: 13
데이터 파이프라인은 구조화된 스트리밍 방식을 사용하여 Kafka에서 Delta Lake로 데이터를 수집합니다. 데이터는 Bronze 테이블에 저장되며, Kafka에서 생성된 타임스탬프, 키, 값이 포함됩니다. 파이프라인 배포 후 3개월이 지난 시점에서 데이터 엔지니어링 팀은 특정 시간대에 지연 현상이 발생하는 것을 발견했습니다.
선임 데이터 엔지니어가 Delta 테이블의 스키마와 데이터 수집 로직을 업데이트하여 Apache Spark에서 기록한 현재 타임스탬프와 Kafka 토픽 및 파티션을 포함시켰습니다. 팀은 추가된 메타데이터 필드를 사용하여 일시적인 처리 지연을 진단할 계획입니다.
이 문제를 진단하는 과정에서 팀은 어떤 제약에 직면하게 될까요?
데이터 파이프라인은 구조화된 스트리밍 방식을 사용하여 Kafka에서 Delta Lake로 데이터를 수집합니다. 데이터는 Bronze 테이블에 저장되며, Kafka에서 생성된 타임스탬프, 키, 값이 포함됩니다. 파이프라인 배포 후 3개월이 지난 시점에서 데이터 엔지니어링 팀은 특정 시간대에 지연 현상이 발생하는 것을 발견했습니다.
선임 데이터 엔지니어가 Delta 테이블의 스키마와 데이터 수집 로직을 업데이트하여 Apache Spark에서 기록한 현재 타임스탬프와 Kafka 토픽 및 파티션을 포함시켰습니다. 팀은 추가된 메타데이터 필드를 사용하여 일시적인 처리 지연을 진단할 계획입니다.
이 문제를 진단하는 과정에서 팀은 어떤 제약에 직면하게 될까요?
Correct Answer: C
Explanation: Only visible for Pass4Test members. You can sign-up / login (it's free).
QUESTION NO: 14
신입 데이터 엔지니어가 silver_device_recordings라는 Lakehouse 테이블에 대한 로직을 구현하는 작업을 진행하고 있습니다.
원본 데이터는 고도로 중첩된 JSON 구조에 100개의 고유 필드를 포함하고 있습니다.
silver_device_recordings 테이블은 여러 프로덕션 모니터링 대시보드와 프로덕션 모델을 구동하는 데 사용될 예정입니다. 현재 100개 필드 중 45개가 이러한 애플리케이션 중 하나 이상에서 사용되고 있습니다.
데이터 엔지니어는 데이터의 고도로 중첩된 구조와 수많은 필드를 고려하여 스키마 선언을 처리하는 최적의 접근 방식을 찾으려고 노력하고 있습니다.
다음 중 Delta Lake와 Databricks에 대한 정보를 정확하게 제시하여 그들의 의사 결정 과정에 영향을 미칠 수 있는 것은 무엇입니까?
신입 데이터 엔지니어가 silver_device_recordings라는 Lakehouse 테이블에 대한 로직을 구현하는 작업을 진행하고 있습니다.
원본 데이터는 고도로 중첩된 JSON 구조에 100개의 고유 필드를 포함하고 있습니다.
silver_device_recordings 테이블은 여러 프로덕션 모니터링 대시보드와 프로덕션 모델을 구동하는 데 사용될 예정입니다. 현재 100개 필드 중 45개가 이러한 애플리케이션 중 하나 이상에서 사용되고 있습니다.
데이터 엔지니어는 데이터의 고도로 중첩된 구조와 수많은 필드를 고려하여 스키마 선언을 처리하는 최적의 접근 방식을 찾으려고 노력하고 있습니다.
다음 중 Delta Lake와 Databricks에 대한 정보를 정확하게 제시하여 그들의 의사 결정 과정에 영향을 미칠 수 있는 것은 무엇입니까?
Correct Answer: B
Explanation: Only visible for Pass4Test members. You can sign-up / login (it's free).




