내 퀴즈
오답노트
캘린더
탐색
로그인
회원가입
QUIZ · 문제 풀이
빅데이터 분석기사 필기 : 빅데이터 탐색 (2과목) 문제은행
자격증
·
총 10문제
·
낱말카드
📝
한번에 풀기
1 / 10문제
0:00
Q1.
'표준편차'에 대한 설명으로 가장 옳은 것은?
1
데이터가 평균으로부터 얼마나 퍼져 있는지를 나타내는 산포 지표로, 분산의 양의 제곱근이다.
2
데이터 집합에서 가장 자주 등장하는 값으로 대표값에 해당한다.
3
전체 분포 중 특정 비율이 이하인 값을 나타내는 분위수다.
4
두 변수가 함께 변하는 방향과 크기를 나타내는 통계량이다.
정답 처리
(₩)
복습 큐
💡 해설
표준편차는 원 데이터와 단위가 같아 해석이 쉬우며, 분포의 퍼짐 정도를 나타내는 가장 일반적인 산포도 통계량이다.
🤔
정답 확인
(Enter)
다음 문제
→
(Tab)
Q2.
'교차 검증(Cross-Validation)'에 대한 설명으로 가장 옳은 것은?
1
데이터를 k개 폴드로 나눠 k번 학습·검증을 반복해 모델 성능의 일반화 능력을 안정적으로 추정하는 방법이다.
2
결측값을 복원 추출로 반복 대체해 불확실성을 추정하는 방법이다.
3
두 그룹 간 평균 차이를 검정하는 통계 방법이다.
4
피처를 선형 결합해 차원을 줄이는 기법이다.
정답 처리
(₩)
복습 큐
💡 해설
k-폴드 교차검증은 표본 크기가 제한될 때 과적합을 방지하며 모델 성능을 신뢰성 있게 평가하는 표준 방법이다.
🤔
정답 확인
(Enter)
다음 문제
→
(Tab)
Q3.
'전진 선택법(Forward Selection)'에 대한 설명으로 가장 옳은 것은?
1
변수가 없는 상태에서 시작해 예측 성능을 가장 많이 향상시키는 변수를 순차적으로 추가하는 래퍼 방법이다.
2
모든 변수를 포함한 상태에서 시작해 기여도가 낮은 변수를 하나씩 제거하는 방법이다.
3
모든 가능한 변수 부분집합을 탐색해 최적 조합을 찾는 방법이다.
4
L1 정규화로 계수를 0으로 수렴시켜 자동으로 변수를 선택하는 방법이다.
정답 처리
(₩)
복습 큐
💡 해설
전진 선택법은 빈 모델에서 시작해 성능 개선에 가장 기여하는 변수를 반복 추가한다. 후진 제거법보다 계산량이 적다.
🤔
정답 확인
(Enter)
다음 문제
→
(Tab)
Q4.
다음 상황에서 가장 적절한 개념은?
Lasso 회귀에서 계수가 0으로 수렴한 피처를 제거해 핵심 변수 20개만 남겼다.
1
임베디드 기법(Embedded Method)
2
필터 기법
3
래퍼 기법
4
차원축소
정답 처리
(₩)
복습 큐
💡 해설
Lasso의 L1 정규화는 모델 학습 중 불필요 피처의 계수를 0으로 수렴시켜 피처 선택을 내장(embedded) 방식으로 수행한다.
🤔
정답 확인
(Enter)
다음 문제
→
(Tab)
Q5.
다음 상황에서 가장 적절한 개념은?
마케팅 캠페인 전후 동일 고객 30명의 브랜드 인식 점수 변화가 통계적으로 유의한지 검증한다.
1
대응표본 t-검정
2
독립표본 t-검정
3
카이제곱 검정
4
ANOVA
정답 처리
(₩)
복습 큐
💡 해설
동일 개체에서 처리 전·후 두 측정값의 차이를 검정할 때 대응표본 t-검정이 적합하다.
🤔
정답 확인
(Enter)
다음 문제
→
(Tab)
Q6.
'다중 검정 문제(Multiple Testing Problem)'에 대한 설명으로 가장 옳은 것은?
1
여러 가설을 동시에 검정하면 개별 유의수준 α이더라도 전체 1종 오류율이 증가하는 문제로, Bonferroni 보정 등으로 제어한다.
2
단일 검정에서 검정력이 낮아 2종 오류가 증가하는 문제다.
3
대규모 표본에서 작은 효과도 유의하게 나타나는 문제다.
4
표본 편향으로 추정량이 모수에서 체계적으로 벗어나는 문제다.
정답 처리
(₩)
복습 큐
💡 해설
m개 검정을 α=0.05로 동시 수행 시 가족별 오류율(FWER)은 1-(0.95)^m으로 급증한다. FDR 제어(Benjamini-Hochberg)도 널리 사용된다.
🤔
정답 확인
(Enter)
다음 문제
→
(Tab)
Q7.
'노이즈 제거'에 대한 설명으로 가장 옳은 것은?
1
측정 오류·시스템 에러 등으로 삽입된 무작위 오류값을 필터링하거나 평활화하는 작업이다.
2
개인정보를 식별 불가능하게 변환하는 작업이다.
3
데이터를 0~1 범위로 선형 변환하는 작업이다.
4
범주형 변수를 수치형으로 인코딩하는 작업이다.
정답 처리
(₩)
복습 큐
💡 해설
노이즈 제거는 무작위 오류값을 스무딩·필터링으로 제거해 데이터 신호를 명확히 하는 정제 작업이다.
🤔
정답 확인
(Enter)
다음 문제
→
(Tab)
Q8.
'로버스트 회귀(Robust Regression)'에 대한 설명으로 가장 옳은 것은?
1
이상값에 의한 영향을 줄이기 위해 손실 함수를 수정해 이상값에 대한 페널티를 낮추는 회귀 기법이다.
2
모든 변수에 L2 정규화를 적용해 계수 크기를 줄이는 회귀 기법이다.
3
레이블이 없는 데이터에서 숨겨진 구조를 찾는 비지도 회귀 기법이다.
4
시계열 데이터의 계절성을 제거한 뒤 추세를 추정하는 회귀 기법이다.
정답 처리
(₩)
복습 큐
💡 해설
Huber 손실·M-추정 기반의 로버스트 회귀는 이상값이 존재해도 회귀계수 추정이 크게 왜곡되지 않도록 설계된다.
🤔
정답 확인
(Enter)
다음 문제
→
(Tab)
Q9.
다음 상황에서 가장 적절한 개념은?
연간 전기 소비량 데이터에서 지속적 증가 추세와 여름·겨울 피크 패턴을 별도로 확인한다.
1
시계열 분해
2
공간 데이터 탐색
3
다변량 분석
4
교차 검증
정답 처리
(₩)
복습 큐
💡 해설
추세와 계절성 성분을 분리해 시계열 구조를 파악하는 기법이 시계열 분해다.
🤔
정답 확인
(Enter)
다음 문제
→
(Tab)
Q10.
다음 상황에서 가장 적절한 개념은?
10만 개 뉴스 기사에서 각 기사를 대표하는 주요 단어의 중요도를 자동 산출해 분류 모델에 입력한다.
1
TF-IDF
2
워드 클라우드
3
자기상관
4
히트맵
정답 처리
(₩)
복습 큐
💡 해설
TF-IDF는 문서별 단어 중요도를 수치화해 텍스트 분류·검색·클러스터링의 피처로 활용하는 핵심 기법이다.
🤔
정답 확인
(Enter)
채점 및 종료
🏁
(Tab)
홈
학습
라이브러리
프로필
전체 메뉴
✕
학습
홈
탐색
캘린더
공식자료
회원가입
로그인