- 데이터셋과 데이터베이스의 개념을 설명할 수 있다.
- 서로 다른 데이터셋을 '키'로 연결해 통합하는 의미를 이해한다.
- 데이터 통합이 왜 새로운 가치를 만드는지 예를 들어 설명할 수 있다.
생각 열기 — 따로 놀던 기록들이 하나가 될 때
병원을 옮길 때마다 검사를 처음부터 다시 한 경험, 있나요? 같은 사람의 건강 기록인데도 병원마다 따로 보관돼 있어서예요. 만약 (본인 동의 아래) 흩어진 기록이 하나로 연결된다면, 의사는 과거 병력과 약물 정보를 한눈에 보고 더 안전하고 빠른 진료를 할 수 있겠죠. 흩어진 데이터를 잇는 것만으로 전에 없던 가치가 생겨나는 거예요.
우리 학교에 '학생 기본정보(학번·이름·반)'와 '도서 대출 기록(학번·책 제목)'이 따로 있다고 해 봐요. 이 둘을 연결하면 어떤 새로운 사실을 알 수 있을까요? 무엇을 기준으로 연결해야 할까요?
데이터를 담는 그릇 — 데이터셋과 데이터베이스
분석을 하려면 데이터를 잘 담아 두어야 해요. 데이터를 담는 단위를 점점 키워 가며 살펴봐요.
'172', '김하준'처럼 하나하나의 값.
하나의 주제로 모은 데이터 묶음. 보통 행과 열로 된 '하나의 표'를 떠올리면 돼요. (예: 우리 반 신체검사 표)
여러 데이터셋을 체계적으로 저장·관리하는 큰 저장소. 중복을 줄이고, 빠르게 찾고, 안전하게 지켜요.
데이터베이스(DB)는 말하자면 잘 정리된 도서관이에요. 책(데이터)을 아무 데나 쌓아 두지 않고, 분류 규칙에 따라 책장(표)에 꽂고, 목록으로 빠르게 찾을 수 있게 하죠. 이런 데이터베이스를 관리하는 프로그램을 DBMS라고 하고, 데이터를 다루는 대표적인 언어가 SQL이에요.
데이터베이스의 표에서 각 행(데이터)을 유일하게 구별해 주는 열을 '키(특히 기본키)'라고 해요. 학번, 주민등록번호, 회원ID처럼 겹치지 않는 값이죠. 이 키가 바로 다음에 배울 '데이터 통합'의 연결고리가 됩니다.
흩어진 표를 잇는 마법 — 데이터 통합
분석에 필요한 데이터가 한 표에 다 들어 있는 경우는 드물어요. 보통 여러 표에 흩어져 있죠. 이때 공통된 열(키)을 기준으로 표들을 연결하는 것을 데이터 통합(JOIN)이라고 해요. 통합하면 각 표 혼자서는 답할 수 없던 질문에 답할 수 있게 됩니다. 직접 해 봅시다!
아래 두 데이터셋이 있어요. "3학년 학생이 가장 많이 산 상품은?"에 답하려면 두 표를 연결해야 해요. 어떤 열(키)로 연결해야 할까요?
| 회원ID | 이름 | 학년 |
|---|---|---|
| M01 | 김하준 | 3 |
| M02 | 이서연 | 1 |
| M03 | 박지후 | 3 |
| 회원ID | 상품 | 금액 |
|---|---|---|
| M01 | 샤프 | 2000 |
| M01 | 노트 | 3000 |
| M03 | 샤프 | 2000 |
| M02 | 색연필 | 5000 |
| M03 | 샤프 | 2000 |
연결할 키를 고르세요 👇
통합은 가치이자 도전
연결의 힘, 그리고 정리의 수고
방금 봤듯, 회원 표엔 '학년'은 있지만 '무엇을 샀는지'가 없고, 구매 표엔 '상품'은 있지만 '학년'이 없었어요. 둘을 회원ID로 연결해야 비로소 "3학년이 가장 많이 산 상품"이라는 새로운 답이 나왔죠. 이것이 데이터 통합의 가치예요 — 1 + 1이 2가 아니라 그 이상이 됩니다.
현실의 데이터를 합치려면 넘어야 할 산이 많아요. ① 공통 키가 없거나 표마다 다른 경우, ② 같은 사람인데 표기가 다른 경우('김민준' vs '김 민준', 'M01' vs '1번'), ③ 날짜·단위 형식이 다른 경우('2026-06-16' vs '6/16/26', kg vs g). 이런 차이를 맞춰 주지 않으면 엉뚱하게 연결돼요. 그래서 데이터 과학자는 통합 전에 형식을 통일하는 데 많은 공을 들인답니다. (2단원 '데이터 전처리'에서 깊이 다뤄요!)
우리 학교의 서로 다른 두 데이터셋을 떠올려 보세요(예: 출석 기록 + 성적, 급식 신청 + 알레르기 정보). ① 무엇을 알고 싶은지(질문) ② 어떤 키로 연결할지 ③ 통합하면 어떤 새 가치가 생기는지를 적어 보세요. ④ 통합할 때 주의할 점(개인정보 보호 포함)도 함께 생각해 봅시다.
확인 문제
바로바로 채점!
3차시 확인 문제
4문항 · 즉시 채점
1여러 데이터셋을 체계적으로 저장·관리하는 큰 저장소를 무엇이라 할까?
2두 데이터셋을 통합(연결)하기 위해 반드시 필요한 것은?
3표에서 각 행을 유일하게 구별하는 '키(기본키)'로 가장 알맞은 것은?
4[OX] 데이터를 통합할 때 같은 대상이라도 표기나 형식이 다르면 잘못 연결될 수 있어, 형식 통일이 중요하다.
더 알아보기
교과서 너머의 이야기 — 클릭해서 펼쳐 보세요
개념표 vs 표 — 관계형 데이터베이스의 아이디어
오늘날 가장 널리 쓰이는 데이터베이스는 관계형 데이터베이스(RDB)예요. 핵심 아이디어는 간단해요 — 모든 데이터를 '표(table)'로 나눠 저장하고, 표들 사이를 '키'로 연결하는 거죠. 예를 들어 쇼핑몰은 '회원 표', '상품 표', '주문 표'를 따로 두고, 주문 표에 회원ID와 상품ID를 적어 서로 연결해요. 왜 이렇게 나눌까요? 만약 모든 걸 한 표에 넣으면, 회원이 주문할 때마다 이름·주소를 매번 반복 저장해야 해 중복과 오류가 넘쳐요. 표로 나누면 회원 정보는 한 번만 저장하고 필요할 때 연결해 쓰면 되죠. 이렇게 중복을 줄이는 설계가 관계형 데이터베이스의 힘이에요. 우리가 쓴 '통합(JOIN)'은 바로 이 나뉜 표들을 다시 합치는 작업이랍니다.
확장표만으론 부족해 — NoSQL과 빅데이터
관계형 데이터베이스는 강력하지만, 비정형 데이터(사진·영상·SNS 글)가 폭발하면서 '모든 것을 깔끔한 표로'라는 방식이 한계를 만났어요. 페이스북·유튜브처럼 어마어마하고 형식이 제각각인 데이터를 다루기 위해 NoSQL이라는 새로운 종류의 데이터베이스가 등장했죠. 표 대신 문서(JSON 같은), 키-값 쌍, 그래프 등 유연한 형태로 데이터를 담아요. 또 데이터가 한 대의 컴퓨터에 다 안 들어갈 만큼 커지면서, 수많은 컴퓨터에 데이터를 나눠 저장하고 동시에 처리하는 분산 처리 기술(예: 하둡)도 발전했어요. '어떤 그릇에 데이터를 담을까'는 데이터의 종류와 양에 따라 계속 진화하고 있는 거예요.
사회연결의 두 얼굴 — 공공데이터와 마이데이터
데이터 통합의 힘이 커지면서, 사회도 바뀌고 있어요. 정부와 공공기관은 가지고 있던 데이터를 누구나 쓸 수 있게 공개하는 '공공데이터 개방'을 추진해요(data.go.kr). 버스 도착 정보 앱, 미세먼지 앱은 모두 공공데이터를 통합·활용한 결과죠. 또 흩어진 내 정보(은행·병원·통신)를 내 동의 아래 한곳에 모아 활용하는 '마이데이터' 서비스도 등장했어요. 그런데 데이터가 연결될수록 편리함과 위험이 함께 커져요 — 여러 데이터가 합쳐지면 한 사람에 대해 너무 많은 것을 알아낼 수 있어 사생활 침해 우려가 생기죠. 그래서 '익명 처리', '동의', '꼭 필요한 만큼만'이라는 데이터 윤리가 통합 기술만큼 중요해진답니다.