단원 홈
3단원 · 마무리

단원 마무리

회귀로 예측하고, 군집으로 묶고, 연관으로 관계를 찾고, 평가로 가장 좋은 모델을 골랐습니다. 데이터 과학의 핵심부를 모두 거쳤어요. 정리하고 평가로 완성하세요!

12데과03-0103-0203-03 03-0403-0503-06
🧠

핵심 정리 — 개념 지도

가지를 클릭하면 핵심 요약이 나타나요!

데이터 모델링·평가 만들고·해석·평가 🧩 1차시 · 모델·도구 모델 개념/4종/지도·비지도 📈 2차시 · 회귀 최소제곱 vs 경사하강 👥 3차시 · 군집 유사성·거리 / k-평균 🔗 4차시 · 연관 지지도·신뢰도·향상도 🏆 5차시 · 평가·선택 오차·정확도 / 방법 선택
🧭 단원의 큰 그림 — 잘 준비한 데이터(2단원)로 이제 모델을 만든다. 모델은 데이터에서 찾은 규칙으로, 목적에 따라 회귀(예측)·분류·군집(묶기)·연관(관계)으로 나뉜다. 회귀를 통계·기계학습 두 길로 비교하고(2차시), 군집(3차시)과 연관(4차시)으로 숨은 구조를 찾은 뒤, 평가·비교로 가장 적합한 방법을 선택한다(5차시). '만들고 → 해석하고 → 평가·비교하라'가 핵심.
🧩 데이터 모델과 도구 [12데과03-01]
· 모델 = 데이터 속 패턴을 규칙으로 요약·단순화(지도 비유)
· 분석 모델 4종: 회귀(숫자 예측)·분류(범주)·군집(묶기)·연관(관계)
· 지도학습(회귀·분류, 정답 있음) vs 비지도학습(군집·연관, 정답 없음)
· 도구: 스프레드시트·파이썬(판다스·사이킷런)·R·BI 도구 — 도구보다 '생각'이 핵심
📈 회귀 — 통계 vs 기계학습 [12데과03-02]
· 회귀 = 점들에 가장 잘 맞는 직선(오차 최소)으로 숫자 예측
· 통계적 회귀(최소제곱): 공식으로 한 번에, 해석(기울기=영향)에 강함
· 기계학습 회귀(경사하강): 오차를 줄이며 반복 학습, 복잡한 경우에 유연
· 둘 다 비슷한 답에 도달(가는 길이 다름) / 외삽(범위 밖 예측) 주의, 상관≠인과
👥 군집 분석 [12데과03-03]
· 정답 없이 비슷한(가까운) 것끼리 묶음(비지도) / 유사성 = 거리(정규화 필요)
· k-평균: 중심 찍기 → 가까운 중심에 배정 → 중심을 평균으로 이동 → 반복
· k는 사람이 정함, 초기값에 따라 결과 변동 → 여러 번 해 보고 해석
· 활용: 고객 세분화·이상 탐지 / 묶음의 윤리(프로파일링) 주의
🔗 연관 분석 [12데과03-04]
· 함께 일어나는 관계(장바구니 분석), 규칙 'A → B'
· 지지도(함께 산 비율)·신뢰도(A 중 B 비율)·향상도(우연 대비)
· 향상도 >1 양의 연관, =1 무관, <1 음의 연관 / 신뢰도만 보면 흔한 것에 속음
· 활용: 매대 배치·추천·묶음 / 상관≠인과, 사생활 윤리
🏆 평가와 방법 선택 [12데과03-05·06]
· 훈련/테스트 분리 — 안 본 데이터로 '진짜 실력' 평가(과적합 방지)
· 회귀=오차(작을수록↑), 분류=정확도(클수록↑) / 정확도의 함정→정밀도·재현율
· 여러 방법·모델을 비교·평가해 목적에 가장 적합한 것 선택
· 좋은 모델 = 정확도 + 설명 가능성 + 공정성 + 목적 적합성
🏆

단원평가

12문항 · 모두 풀고 [채점하기]를 누르세요. 해설과 함께 결과가 나와요!

🏆

3단원 종합 평가

객관식 8 + OX 4 · 일괄 채점

1데이터 모델에 대한 설명으로 알맞은 것은?

2'내년 매출액(숫자)을 예측'하기에 알맞은 분석은?

3통계적 회귀(최소제곱)와 기계학습 회귀(경사하강)의 차이로 알맞은 것은?

4군집 분석에서 '비슷하다'를 판단하는 기준은?

5k-평균 알고리즘의 핵심 과정은?

6연관 규칙 'A → B'에서 신뢰도의 뜻은?

7향상도(lift)가 1보다 클 때의 올바른 해석은?

8모델을 훈련 데이터와 테스트 데이터로 나누어 평가하는 이유는?

9[OX] k-평균에서 군집 수 k는 사람이 정하며, 초기 중심에 따라 결과가 달라질 수 있다.

10[OX] 회귀선은 학습 데이터 범위를 크게 벗어난 값도 항상 정확히 예측한다.

11[OX] 정확도가 높기만 하면 그 모델은 항상 좋은 모델이다.

12[OX] 분석 방법은 목적에 따라 최적이 달라지므로, 여러 방법을 비교·평가해 선택하는 것이 좋다.

0 / 12

✍️

서·논술형 자기 점검

먼저 스스로 써 본 뒤 예시 답안과 비교해 보세요.

1. 같은 '공부 시간 → 성적' 데이터를 통계적 회귀(최소제곱)와 기계학습 회귀(경사하강)로 분석한다고 할 때, ① 두 방법이 결과(직선)에서 어떻게 같고 ② 방법·관점에서 어떻게 다른지 비교하시오. 12데과03-02

📖 예시 답안 ① 공통점: 두 방법 모두 '오차(잔차)를 가장 작게 하는 직선'을 찾는 것이 목표라, 이런 단순한 데이터에서는 거의 같은 회귀선에 도달해 예측값도 비슷하다. ② 차이: 최소제곱법은 오차를 최소로 하는 직선을 공식으로 한 번에 계산하고 '기울기 = 영향력'처럼 해석에 강하다. 경사하강법은 아무 직선에서 시작해 오차를 조금씩 줄이며 반복 학습하고, 변수가 많거나 관계가 복잡해 공식으로 풀기 어려울 때도 쓸 수 있어 유연하다. 목적이 '설명·이해'면 통계적 회귀, '복잡한 예측'이면 기계학습 회귀가 유리하다. — 공통점(같은 목표·비슷한 직선)과 차이(계산 방식·관점)를 함께 담으면 만점!

2. 어느 마트의 고객·거래 데이터가 있다. ① 군집 분석으로 무엇을 알 수 있고 어떻게 활용할지, ② 연관 분석으로 무엇을 알 수 있고 어떻게 활용할지, 두 분석이 답하는 질문의 차이를 들어 설명하시오. 12데과03-03 12데과03-04

📖 예시 답안 ① 군집 분석: 비슷한 고객끼리(예: 나이·구매액으로) 묶어 고객 집단(세분화)을 찾는다. "어떤 손님들이 있나?"에 답하며, VIP엔 혜택, 휴면 고객엔 쿠폰 같은 맞춤 마케팅에 쓴다. ② 연관 분석: 거래에서 함께 팔리는 상품의 관계(A→B)를 찾는다. "무엇과 무엇이 함께 팔리나?"에 답하며, 향상도>1인 짝을 매대 배치·묶음 추천에 쓴다. 차이: 군집은 '사람(데이터)을 묶는' 분석, 연관은 '항목 간 관계를 찾는' 분석이다. 둘 다 정답이 없는 비지도학습이지만 답하는 질문이 다르다. — 두 분석이 각각 무엇을 묶고/찾는지와 활용, 질문의 차이를 담으면 만점!

3. 매출을 예측하는 두 모델 A·B가 있다. ① 어떤 모델이 더 좋은지 어떻게 평가·비교할지 (지표 포함) 설명하고, ② '정확도(또는 오차)가 좋은 모델이 항상 최선은 아닐 수 있다'는 말의 의미를, 분석 목적과 함께 논하시오. 12데과03-05 12데과03-06

📖 예시 답안 ① 평가·비교: 두 모델을 한 번도 안 본 테스트 데이터에 적용해, 회귀이므로 예측 오차(평균 오차·RMSE)를 구해 더 작은 모델을 고른다(분류라면 정확도·정밀도·재현율). 한 번의 분할에 휘둘리지 않도록 여러 번 평가(교차 검증)해 평균을 보면 더 안정적이다. ② 정확도가 전부가 아닌 이유: 좋은 모델은 정확도뿐 아니라 설명 가능성·공정성·목적 적합성도 중요하다. 예컨대 대출·채용처럼 이유가 중요한 결정에서는 조금 덜 정확해도 설명 가능한 모델이, 특정 집단에서만 자주 틀리면 아무리 전체 정확도가 높아도 공정하지 못한 모델이다. 그래서 분석 목적에 맞는 지표와 모델을 골라야 한다. — 테스트 평가·지표로 비교(03-05)와 목적에 따른 선택·정확도의 한계(03-06)를 함께 담으면 만점!
🪞

성취기준 자가평가

스스로 솔직하게 점검해 보세요. 선택은 자동 저장됩니다.

12데과03-01  데이터 모델 개념을 이해하고 분석 도구를 탐색할 수 있다.

12데과03-02  통계적 회귀와 기계학습 회귀로 분석해 결과를 비교할 수 있다.

12데과03-03  유사성을 측정해 군집을 형성하고 결과를 해석할 수 있다.

12데과03-04  데이터 간 연관성을 분석하고 결과의 의미를 해석할 수 있다.

12데과03-05  분석 방법에 따른 모델의 결과를 비교·평가할 수 있다.

12데과03-06  분석 목적에 가장 적합한 분석 방법을 선택·적용할 수 있다.

💡 다시 보면 좋은 곳

모델 개념은 분석 모델 탐험기, 회귀는 회귀 실험실, 군집은 k-평균 시뮬레이터, 연관은 장바구니 분석기, 평가는 모델 성능 비교기로 — 직접 만져 본 만큼 오래 남습니다!

🧭

진로 연계 — 모델을 다루는 직업들

🔬

데이터 과학자

회귀·군집·연관 모델을 만들고 평가해 문제를 풀어요.

🤖

머신러닝 엔지니어

예측·추천 모델을 개발하고 서비스에 적용해요.

📊

비즈니스 분석가

모델 결과를 해석해 사업 의사 결정을 도와요.

🏬

마케팅 데이터 분석가

고객 세분화·장바구니 분석으로 마케팅을 설계해요.

🩺

의료·바이오 데이터 분석가

진단·예측 모델을 평가해 건강을 도와요.

👀 다음 단원 예고 — 4단원 「데이터 과학 프로젝트」 (과목의 피날레!)

데이터를 이해하고(1단원), 준비·분석하고(2단원), 모델을 만들어 평가하는 법(3단원)까지 배웠어요. 이제 배운 모든 것을 모아 직접 데이터 과학 프로젝트를 수행할 차례! 실제 문제를 정하고, 데이터를 모아 탐색하고, 두 가지 이상의 방법으로 분석·비교해 결과를 해석하고, 그 활용과 사회적 영향까지 성찰하는 — 진짜 데이터 과학자의 여정을 완성합니다.