단원 홈
2단원 · 마무리

단원 마무리

편향 없이 모으고, 깨끗이 손질하고, 관계를 찾고, 여러 방법으로 비교하기 — 데이터 분석의 '진짜 실력'을 길렀습니다. 정리하고 평가로 완성하세요!

12데과02-0112데과02-02 12데과02-0312데과02-04
🧠

핵심 정리 — 개념 지도

가지를 클릭하면 핵심 요약이 나타나요!

데이터 준비와 분석 분석의 8할은 준비 🎯 1차시 · 수집·특성 표본·편향 / 대푯값 🧹 2차시 · 전처리 이상치·결측치/정규화/시각화 🔗 3차시 · 관계·통합 상관 / 산점도 / 파생변수 🔄 4차시 · 방법 비교 평균vs중앙값 / 교차검증
🧭 단원의 큰 그림 — 좋은 분석은 좋은 준비에서 나온다. 편향 없이 모으고(1차시), 이상치·결측치를 손질하고 정규화·시각화하며(2차시), 속성 간 관계를 찾고 통합하고(3차시), 같은 데이터를 여러 방법으로 비교한다(4차시). "쓰레기를 넣으면 쓰레기가 나온다(GIGO)" — 데이터를 의심하고 손질하는 태도가 분석의 핵심이다.
🎯 편향 없는 수집과 특성 분석 [12데과02-01]
· 전수조사 vs 표본조사 / 모집단·표본·대표성
· 표집 편향: 표본이 치우치면 많이 모아도 틀림 → 무작위 추출로 줄임
· 기술통계 = 데이터 특성 요약: 평균·중앙값·최빈값
· 평균은 이상치에 약함 → 한쪽으로 치우친 데이터엔 중앙값이 더 대표적, 분포도 함께 보기
🧹 전처리·정규화·시각화 [12데과02-02]
· 결측치(빈 값): 삭제 또는 평균·중앙값·최빈값으로 대체
· 이상치(동떨어진 값): 원인을 따져 오류면 수정·제거, 진짜면 보존(무조건 삭제 ✕)
· 정규화: 단위·범위가 다른 속성을 같은 척도(0~1)로 — (값−최솟값)/(최댓값−최솟값)
· 시각화: 목적에 맞게(비교=막대, 추세=꺾은선, 비율=원, 분포=히스토그램, 관계=산점도)
🔗 속성 간 관계와 통합 [12데과02-03]
· 상관관계: 양(같이↑)·음(하나↑ 다른↓)·무(관계 없음), 산점도로 확인
· 상관계수 r: −1~+1, 부호=방향, 절댓값=세기
· 상관 ≠ 인과: 함께 움직여도 원인은 아닐 수 있음(숨은 공통 원인·우연)
· 파생 변수: 속성을 통합해 새 의미(1인당·BMI·평균) → 공정한 비교·깊은 분석
🔄 같은 데이터, 다른 분석 방법 비교 [12데과02-04]
· 같은 데이터도 방법에 따라 결론이 달라짐
· 평균 vs 중앙값(이상치 영향), 기간 자르기(상승/하락 모두 가능)
· 어느 하나가 거짓이 아니라 다른 질문에 답 → 데이터에 맞는 방법 선택
· 여러 방법으로 비교(상호 대조): 일치하면 신뢰↑, 엇갈리면 더 탐구
🏆

단원평가

11문항 · 모두 풀고 [채점하기]를 누르세요. 해설과 함께 결과가 나와요!

🏆

2단원 종합 평가

객관식 8 + OX 3 · 일괄 채점

1표본이 모집단을 고르게 대표하지 못하고 치우치는 현상은?

2표집 편향을 줄이는 가장 좋은 표본 추출 방법은?

3설문 무응답처럼 '값이 비어 있는' 데이터는?

4키(cm)·연봉(만원)처럼 범위가 다른 속성을 같은 척도로 맞추는 전처리는?

5두 속성의 관계(상관)를 점으로 살피기에 가장 알맞은 그래프는?

6'모금액 ÷ 회원 수 = 1인당 모금액'처럼 속성을 통합해 만든 새 속성은?

7사장만 급여가 매우 높은 회사에서 '평균은 높은데 대부분은 적게 받는' 이유는?

8'월별 매출 변화 추세'를 보여 주기에 가장 알맞은 그래프는?

9[OX] 표본 수가 충분히 많기만 하면, 표본이 한쪽으로 치우쳐 있어도 결과는 정확하다.

10[OX] 두 데이터가 강한 상관을 보이면, 하나가 다른 하나의 원인이라고 단정할 수 있다.

11[OX] 같은 데이터를 여러 분석 방법으로 비교하면 더 믿을 만한 결론에 다가갈 수 있다.

0 / 11

✍️

서·논술형 자기 점검

먼저 스스로 써 본 뒤 예시 답안과 비교해 보세요.

1. 우리 학교 학생들이 가장 좋아하는 점심 메뉴를 조사하려고 한다. ① 모집단과 표본 ② 편향을 막기 위한 표본 추출 방법 ③ 결과를 요약할 대푯값을 어떻게 정할지 설계하시오. 12데과02-01

📖 예시 답안 ① 모집단/표본: 모집단은 우리 학교 전체 학생, 표본은 그중 일부(예: 100명). ② 편향 방지: 특정 장소(매점·운동장)나 친한 사람에게만 묻지 않고, 전교생 번호에서 무작위로 뽑아 학년·반·성별이 고루 섞이게 한다. ③ 대푯값: '가장 좋아하는 메뉴'는 범주형이므로 가장 많이 선택된 최빈값으로 요약하고, 메뉴별 비율을 막대그래프로 함께 보여 준다. — 무작위 추출(편향 방지)과 자료 성격에 맞는 대푯값 선택을 담으면 만점!

2. 어떤 표에 ① 비어 있는 칸(결측치)과 ② 나이 '200세'(이상치), ③ 키(cm)와 연봉(만원)처럼 범위가 매우 다른 두 속성이 있다. 각각을 어떻게 처리(전처리)할지 설명하시오. 12데과02-02

📖 예시 답안 ① 결측치: 비어 있는 칸은 결측치이므로, 그 행을 삭제하거나 그 속성의 평균·중앙값(또는 범주면 최빈값)으로 채워(대체) 넣는다. ② 이상치: 나이 200세는 사람에게 불가능하므로 입력 오류로 보고 올바른 값으로 고치거나 해당 값을 제거한다(단, 이상치가 늘 오류는 아니므로 원인을 먼저 확인한다). ③ 정규화: 키와 연봉은 범위가 크게 달라 그대로 함께 쓰면 연봉이 분석을 지배하므로, (값−최솟값)/(최댓값−최솟값)으로 0~1 범위에 맞추는 정규화를 한다. — 결측·이상치·정규화 처리 방법과 그 이유를 함께 쓰면 만점!

3. '공부 시간'과 '성적' 데이터가 있다. ① 두 속성의 관계를 어떻게 분석할지(상관·산점도) 설명하고, ② 같은 데이터를 서로 다른 방법(예: 평균 vs 중앙값, 전체 기간 vs 일부 구간)으로 분석하면 결과가 어떻게 달라질 수 있는지, 왜 여러 방법으로 비교해야 하는지 서술하시오. 12데과02-03 12데과02-04

📖 예시 답안 ① 관계 분석: 가로축에 공부 시간, 세로축에 성적을 두고 산점도를 그려 점들의 방향을 본다. 점들이 오른쪽 위로 향하면 양의 상관(공부할수록 성적↑)이며, 상관계수 r로 세기를 확인한다. 단, 상관이 있어도 '공부가 성적의 유일한 원인'이라 단정하지 않는다(상관≠인과). ② 다른 방법 비교: 반 평균 성적은 한두 명의 아주 높거나 낮은 점수(이상치)에 끌릴 수 있어, 평균과 중앙값이 다를 수 있다. 또 '시험 전 한 주'만 보면 급상승처럼, 학기 전체를 보면 완만한 변화처럼 보일 수 있다. 그래서 여러 방법으로 분석해 결과가 일치하는지 비교(상호 대조)해야 한 가지 방법의 함정에 빠지지 않고 더 믿을 만한 결론을 얻는다. — 산점도·상관(02-03)과 방법별 결과 차이·상호 대조(02-04)를 함께 담으면 만점!
🪞

성취기준 자가평가

스스로 솔직하게 점검해 보세요. 선택은 자동 저장됩니다.

12데과02-01  편향되지 않게 데이터를 수집하고, 대푯값·분포로 특성을 분석할 수 있다.

12데과02-02  이상치·결측치를 처리하고 정규화·시각화로 전처리할 수 있다.

12데과02-03  속성 간 관계(상관)를 파악하고 통합해 파생 변수를 만들 수 있다.

12데과02-04  같은 데이터에 서로 다른 분석 방법을 적용해 결과를 비교할 수 있다.

💡 다시 보면 좋은 곳

수집·대푯값은 표본 편향 실험실·대푯값 비교기, 전처리는 데이터 클리닝 실습실·정규화 위젯, 관계는 상관관계 탐험기, 방법 비교는 결론 뒤집기·기간 자르기 실험실로 — 직접 만져 본 만큼 남습니다!

🧭

진로 연계 — 데이터를 다루는 직업들

📊

데이터 분석가

데이터를 정제·분석·시각화해 의사 결정을 도와요.

📈

통계 전문가

표본 설계와 통계로 사회·경제 현상을 밝혀요.

🔬

데이터 과학자

전처리부터 모델링까지 데이터의 전 과정을 다뤄요.

🗞️

데이터 저널리스트

데이터로 진실을 검증하고 정직한 그래프로 전해요.

🏛️

여론·조사 전문가

편향 없는 설문으로 사람들의 생각을 정확히 읽어요.

👀 다음 단원 예고 — 3단원 「데이터 모델링과 평가」

데이터를 잘 준비하고 분석하는 법을 익혔으니, 이제 데이터로 예측하고 분류하는 '모델'을 만들 차례예요! 통계적 회귀와 기계학습으로 미래를 예측하고, 비슷한 것끼리 묶는 군집 분석, 함께 팔리는 상품을 찾는 연관 분석을 배우고, 그 결과를 평가하고 비교합니다. 데이터 과학의 핵심부로 한 걸음 더 들어가요!