핵심 정리 — 개념 지도
가지를 클릭하면 핵심 요약이 나타나요!
· 전수조사 vs 표본조사 / 모집단·표본·대표성
· 표집 편향: 표본이 치우치면 많이 모아도 틀림 → 무작위 추출로 줄임
· 기술통계 = 데이터 특성 요약: 평균·중앙값·최빈값
· 평균은 이상치에 약함 → 한쪽으로 치우친 데이터엔 중앙값이 더 대표적, 분포도 함께 보기
· 결측치(빈 값): 삭제 또는 평균·중앙값·최빈값으로 대체
· 이상치(동떨어진 값): 원인을 따져 오류면 수정·제거, 진짜면 보존(무조건 삭제 ✕)
· 정규화: 단위·범위가 다른 속성을 같은 척도(0~1)로 — (값−최솟값)/(최댓값−최솟값)
· 시각화: 목적에 맞게(비교=막대, 추세=꺾은선, 비율=원, 분포=히스토그램, 관계=산점도)
· 상관관계: 양(같이↑)·음(하나↑ 다른↓)·무(관계 없음), 산점도로 확인
· 상관계수 r: −1~+1, 부호=방향, 절댓값=세기
· 상관 ≠ 인과: 함께 움직여도 원인은 아닐 수 있음(숨은 공통 원인·우연)
· 파생 변수: 속성을 통합해 새 의미(1인당·BMI·평균) → 공정한 비교·깊은 분석
· 같은 데이터도 방법에 따라 결론이 달라짐
· 평균 vs 중앙값(이상치 영향), 기간 자르기(상승/하락 모두 가능)
· 어느 하나가 거짓이 아니라 다른 질문에 답 → 데이터에 맞는 방법 선택
· 여러 방법으로 비교(상호 대조): 일치하면 신뢰↑, 엇갈리면 더 탐구
단원평가
11문항 · 모두 풀고 [채점하기]를 누르세요. 해설과 함께 결과가 나와요!
2단원 종합 평가
객관식 8 + OX 3 · 일괄 채점
1표본이 모집단을 고르게 대표하지 못하고 치우치는 현상은?
2표집 편향을 줄이는 가장 좋은 표본 추출 방법은?
3설문 무응답처럼 '값이 비어 있는' 데이터는?
4키(cm)·연봉(만원)처럼 범위가 다른 속성을 같은 척도로 맞추는 전처리는?
5두 속성의 관계(상관)를 점으로 살피기에 가장 알맞은 그래프는?
6'모금액 ÷ 회원 수 = 1인당 모금액'처럼 속성을 통합해 만든 새 속성은?
7사장만 급여가 매우 높은 회사에서 '평균은 높은데 대부분은 적게 받는' 이유는?
8'월별 매출 변화 추세'를 보여 주기에 가장 알맞은 그래프는?
9[OX] 표본 수가 충분히 많기만 하면, 표본이 한쪽으로 치우쳐 있어도 결과는 정확하다.
10[OX] 두 데이터가 강한 상관을 보이면, 하나가 다른 하나의 원인이라고 단정할 수 있다.
11[OX] 같은 데이터를 여러 분석 방법으로 비교하면 더 믿을 만한 결론에 다가갈 수 있다.
서·논술형 자기 점검
먼저 스스로 써 본 뒤 예시 답안과 비교해 보세요.
1. 우리 학교 학생들이 가장 좋아하는 점심 메뉴를 조사하려고 한다. ① 모집단과 표본 ② 편향을 막기 위한 표본 추출 방법 ③ 결과를 요약할 대푯값을 어떻게 정할지 설계하시오. 12데과02-01
2. 어떤 표에 ① 비어 있는 칸(결측치)과 ② 나이 '200세'(이상치), ③ 키(cm)와 연봉(만원)처럼 범위가 매우 다른 두 속성이 있다. 각각을 어떻게 처리(전처리)할지 설명하시오. 12데과02-02
3. '공부 시간'과 '성적' 데이터가 있다. ① 두 속성의 관계를 어떻게 분석할지(상관·산점도) 설명하고, ② 같은 데이터를 서로 다른 방법(예: 평균 vs 중앙값, 전체 기간 vs 일부 구간)으로 분석하면 결과가 어떻게 달라질 수 있는지, 왜 여러 방법으로 비교해야 하는지 서술하시오. 12데과02-03 12데과02-04
성취기준 자가평가
스스로 솔직하게 점검해 보세요. 선택은 자동 저장됩니다.
12데과02-01 편향되지 않게 데이터를 수집하고, 대푯값·분포로 특성을 분석할 수 있다.
12데과02-02 이상치·결측치를 처리하고 정규화·시각화로 전처리할 수 있다.
12데과02-03 속성 간 관계(상관)를 파악하고 통합해 파생 변수를 만들 수 있다.
12데과02-04 같은 데이터에 서로 다른 분석 방법을 적용해 결과를 비교할 수 있다.
수집·대푯값은 표본 편향 실험실·대푯값 비교기, 전처리는 데이터 클리닝 실습실·정규화 위젯, 관계는 상관관계 탐험기, 방법 비교는 결론 뒤집기·기간 자르기 실험실로 — 직접 만져 본 만큼 남습니다!
진로 연계 — 데이터를 다루는 직업들
데이터 분석가
데이터를 정제·분석·시각화해 의사 결정을 도와요.
통계 전문가
표본 설계와 통계로 사회·경제 현상을 밝혀요.
데이터 과학자
전처리부터 모델링까지 데이터의 전 과정을 다뤄요.
데이터 저널리스트
데이터로 진실을 검증하고 정직한 그래프로 전해요.
여론·조사 전문가
편향 없는 설문으로 사람들의 생각을 정확히 읽어요.
데이터를 잘 준비하고 분석하는 법을 익혔으니, 이제 데이터로 예측하고 분류하는 '모델'을 만들 차례예요! 통계적 회귀와 기계학습으로 미래를 예측하고, 비슷한 것끼리 묶는 군집 분석, 함께 팔리는 상품을 찾는 연관 분석을 배우고, 그 결과를 평가하고 비교합니다. 데이터 과학의 핵심부로 한 걸음 더 들어가요!