단원 홈
2단원 · 3차시

세상을 읽는 거대한 데이터
빅데이터와 수집

지금 이 순간에도 전 세계에서 초당 수 페타바이트의 데이터가 태어납니다. 이 거대한 흐름의 정체를 이해하고, 문제 해결에 꼭 맞는 데이터를 수집하는 법을 배워 봅시다.

성취기준 12정02-03
빅데이터3V데이터 수집 공공데이터데이터 편향
🎯 학습 목표
  • 빅데이터의 개념과 특징(3V)을 사례를 들어 설명할 수 있다.
  • 다양한 데이터 수집 방법(직접 수집, 센서, 공공·민간 데이터)을 비교할 수 있다.
  • 해결하려는 문제에 적합한 데이터를 편향과 윤리를 고려하여 수집할 수 있다.
🤔

생각 열기 — 도서관에서 데이터센터로

책이 빽빽하게 꽂힌 도서관 서가
인류가 수천 년 동안 지식을 담아 온 곳, 도서관 출처: Wikimedia Commons
대형 모니터가 가득한 관제센터
오늘날 데이터가 모이고 읽히는 곳, 관제센터와 데이터센터 출처: Wikimedia Commons

세계 최대였던 고대 알렉산드리아 도서관의 장서는 수십만 권 — 디지털로 환산하면 수백 GB 남짓으로, 요즘 노트북 하나에 들어가는 양입니다. 그런데 지금 인류는 그만큼의 데이터를 1초도 안 되는 사이에 만들어 내요. 여러분이 단원 열기에서 계산했던 '나의 데이터 발자국'에 80억 명의 발자국을 곱하면… 그것이 바로 빅데이터의 세계입니다.

1

빅데이터란 — 크기만 큰 게 아니다

3V: 규모, 속도, 다양성

빅데이터(big data)는 단순히 '많은 데이터'가 아니라, 기존 방법으로는 다루기 어려운 데이터를 뜻해요. 엑셀에 다 안 들어가고, 다 모으기도 전에 새 데이터가 쏟아지고, 형태도 제각각인 데이터 — 그 특징을 세 가지 V로 정리합니다.

📦

Volume — 엄청난 규모

테라바이트(TB)를 넘어 페타바이트(PB), 제타바이트(ZB) 단위. 예: 한 사람의 유전체 데이터만 수백 GB.

Velocity — 빠른 생성 속도

쉼 없이 실시간으로 쏟아짐. 예: 1초마다 갱신되는 주식 시세, 실시간 교통 정보.

🎨

Variety — 다양한 형태

표 형태의 정형 데이터부터 글·사진·영상·음성 같은 비정형 데이터까지 뒤섞여 있음.

🌍 실시간 데이터 폭발 카운터 LIVE

최근 통계 기반의 추정치로 계산한, 지금 이 순간 세계의 데이터 생성량입니다.

이 페이지를 연 뒤 전 세계에서 새로 생긴 데이터 (추정)
0 TB
▶️
500시간+
1분마다 유튜브에 업로드되는 영상 분량
🔍
수백만 건
1분 동안의 검색 엔진 검색
💬
수천만 건
1분 동안 오가는 메신저 메시지
🛰️
24시간
지구 관측 위성과 IoT 센서는 쉬지 않아요
[참고]연간 약 180제타바이트(1ZB = 10억 TB) 생성 추정(2025년 기준 전망)을 초 단위로 환산한 값이에요. 숫자 자체보다 '규모의 감각'을 느껴 보세요!
🕹️ 활동 1 — 이 사례, 어떤 V가 두드러질까?

각 사례에서 가장 두드러지는 빅데이터의 특징을 골라 보세요. 카드를 누른 뒤 알맞은 바구니 클릭!

📦 Volume (규모)
⚡ Velocity (속도)
🎨 Variety (다양성)

💡 실제 빅데이터는 보통 세 특징을 동시에 가져요 — 여기서는 '가장 두드러지는' 것을 찾는 연습입니다.

🦉 알고 있나요? — 서울의 심야버스는 빅데이터가 그렸다

서울시의 심야버스 '올빼미버스' 노선은 사람이 감으로 정한 게 아니에요. 심야 시간대 휴대전화 통화·문자 데이터 약 30억 건과 심야 택시 승하차 데이터를 분석해, 밤에 사람이 많이 몰리는 곳과 이동 경로를 찾아 노선을 설계했죠. 데이터가 많아질수록(Volume) 도시의 진짜 모습이 보인다는 것을 보여 준 국내 대표 사례입니다.

2

빅데이터는 어디에서 올까

데이터의 생산지를 알면 수집이 보인다

국제우주정거장에서 촬영한 밤의 한반도 — 남쪽은 불빛으로 환하고 북쪽은 어둡다
국제우주정거장(ISS)에서 본 밤의 한반도. 도시의 불빛 하나하나가 사람과 기계가 데이터를 만들어 내는 곳이다 — 이 사진 자체도 위성·우주정거장이 수집한 '데이터'! 출처: NASA / Wikimedia Commons
서울기상관측소의 잔디밭에 관측 장비들이 설치된 모습
서울기상관측소의 관측 노장 — 전국 수백 곳의 관측소가 기온·바람·강수량을 쉬지 않고 기록한다. 1단원에서 배운 IoT 센서가 빅데이터의 거대한 생산자! 출처: Wikimedia Commons (CC0)
🙋

사람의 활동

SNS 게시물, 검색어, 리뷰, 구매 기록, 영상 시청 기록 — 우리가 디지털 세상에 남기는 모든 흔적.

📡

기계와 센서

기상 관측, CCTV, 스마트워치 심박수, 자동차 주행 기록 — 1단원의 IoT 기기들이 24시간 만드는 데이터.

🏛️

공공 기관

인구 통계, 버스 위치, 미세먼지 농도, 학교 정보 — 국가와 지자체가 수집해 시민에게 개방하는 데이터.

🏢

기업의 기록

거래 내역, 물류 이동, 통신 기록 — 기업 활동에서 자동으로 쌓이는 데이터.

3

문제 해결에 적합한 데이터 수집하기

아무 데이터나 많이? No! 맞는 데이터를 바르게!

데이터 수집의 출발점은 데이터가 아니라 문제입니다. "무엇을 알고 싶은가"가 정해져야 "어떤 데이터가, 어디에, 얼마나 필요한가"가 보여요. 수집 방법은 크게 네 갈래입니다.

수집 방법이런 데이터를 얻어요장점 / 주의점
직접 수집
(설문·관찰)
우리 반 친구들의 의견, 교내 매점 대기 시간내 문제에 꼭 맞는 데이터 / 표본이 적고 질문 설계에 따라 답이 왜곡될 수 있음
센서 수집
(피지컬 컴퓨팅)
교실 온도·미세먼지, 화분 토양 수분실시간·자동·객관적 / 센서 오차 점검 필요 (1단원에서 배운 그대로!)
공공데이터
(개방 포털)
인구, 날씨, 대중교통, 상권 통계무료·신뢰성 높음·규모 큼 / 갱신 주기와 항목이 내 문제와 안 맞을 수 있음
민간 데이터
(API·트렌드)
검색어 트렌드, 지도·리뷰 데이터생생한 최신 경향 / 이용 약관·개인정보 규정 확인 필수
💡 보물 창고 — 우리나라 공공데이터 포털들

국가가 운영하는 공공데이터포털(data.go.kr)에는 수만 개의 데이터셋이 무료로 열려 있어요. 그 밖에도 서울 열린데이터광장(서울시의 모든 것), 기상자료개방포털(날씨), KOSIS 국가통계포털(통계청)이 대표적이죠. 버스 도착 알림 앱, 미세먼지 앱 같은 우리가 쓰는 서비스 상당수가 이 공공데이터로 만들어졌답니다.

수집 전 마지막 점검 — 세 가지 질문

⚖️

편향은 없는가?

특정 집단만 조사하면 결과가 기울어요. 점심시간 매점 앞에서만 설문하면? 매점 이용자의 의견만 모이죠!

🔏

개인정보는 안전한가?

이름·연락처 등은 꼭 필요한 만큼만, 동의를 받고, 누구인지 알 수 없게 처리(비식별화)해요. 2차시의 암호화가 여기서도 활약!

🔍

출처는 믿을 만한가?

언제, 누가, 어떻게 만든 데이터인지 확인해요. 오래되거나 출처 불명의 데이터는 잘못된 결론으로 직행합니다.

🧭

수집 방법 선택 연습

시나리오 3개 · 즉시 채점

1"지난 30년간 우리 지역의 여름이 정말 더워졌는지" 분석하려 한다. 가장 적합한 수집 방법은?

2"우리 교실의 시간대별 미세먼지 농도 변화"를 알고 싶다. 가장 적합한 수집 방법은?

3"학교 축제에서 어떤 부스가 인기 있을지" 예측하고 싶다. 가장 적합한 수집 방법과 주의점은?

🛠️ 활동 2 — 데이터 수집 계획서 만들기

모둠별로 우리 학교·동네의 문제를 하나 정하고, 다음 항목으로 수집 계획서를 작성해 보세요. (4차시에서 이 데이터를 시각화·해석하는 활동으로 이어집니다!)

  1. 해결하고 싶은 문제: 예) 등굣길 횡단보도가 위험하다
  2. 필요한 데이터: 무엇을(시간대별 통행량), 어떤 단위로(15분 간격), 얼마나(2주)
  3. 수집 방법과 출처: 직접 관찰? 센서? 공공데이터? — 표에서 고르고 이유 쓰기
  4. 점검: 편향 가능성 / 개인정보 이슈 / 출처 신뢰성 — 세 가지 질문에 답하기

[도전] 공공데이터포털(data.go.kr)에 접속해 우리 문제와 관련된 데이터셋을 실제로 검색하고, 파일(CSV)을 내려받아 첫 10줄을 살펴보세요.

확인 문제

바로바로 채점! 해설까지 꼭 읽어 보세요.

📝

3차시 확인 문제

4문항 · 즉시 채점

1빅데이터의 특징 3V에 해당하지 않는 것은?

2다음 중 비정형 데이터에 가장 가까운 것은?

3"청소년 취미 조사"를 게임 커뮤니티에서만 진행했다. 이 수집의 가장 큰 문제는?

4데이터 수집 과정에서 가장 먼저 해야 할 일은?

🚀

더 알아보기

교육과정 너머, 궁금한 만큼 깊이!

심화3V를 넘어 5V로 — 진실성과 가치

빅데이터가 성숙하면서 두 가지 V가 더해졌어요.

  • Veracity (진실성) — 데이터가 정확하고 믿을 만한가? 가짜 리뷰, 봇이 쓴 댓글, 고장 난 센서의 값… 쓰레기 데이터로는 쓰레기 결론만 나와요(Garbage In, Garbage Out).
  • Value (가치) — 그래서 이 데이터로 무엇을 할 수 있는가? 아무리 크고 빨라도 문제 해결에 쓰이지 못하면 비용만 드는 짐이에요. 빅데이터의 최종 목표는 언제나 가치 창출!
빅데이터 5V Volume 엄청난 규모 Velocity 빠른 생성 속도 Variety 다양한 형태 + Veracity 믿을 수 있는가? + Value 가치를 만드는가? 파란 상자 = 기본 3V · 노란/초록 상자 = 빅데이터가 성숙하며 더해진 2V

수집 전 점검의 '세 가지 질문'이 바로 Veracity를 지키는 습관이고, 4차시에서 배울 시각화·해석이 Value를 캐내는 기술이랍니다.

사례빅데이터의 흑역사 — 구글 독감 트렌드의 추락

2008년 구글은 "독감 관련 검색어가 늘면 독감 환자도 는다"는 아이디어로 보건 당국보다 2주 빠른 독감 유행 예측 서비스를 내놓아 세상을 놀라게 했어요.

하지만 몇 년 뒤, 예측치가 실제의 2배로 빗나가기 시작했습니다. 독감이 뉴스에 자주 나오자 아프지 않은 사람들까지 검색을 했고, 검색 엔진의 추천 기능이 검색량을 부풀렸거든요. 결국 서비스는 종료되었죠.

실제 독감 환자 (보건 당국 집계) 구글 독감 트렌드 예측 독감 환자 수준(상대값) → 실제의 2배 이상! 2009-10 2010-11 2011-12 2012-13 독감 시즌별 정점 비교 — 실제 통계를 단순화한 모식도. 2011년 겨울부터 예측이 실제를 크게 웃돌기 시작했다.

교훈은 분명해요 — 데이터가 크다고 진실에 가까운 것은 아니다. "이 데이터는 어떻게 만들어졌고, 무엇을 빠뜨리고 있나?"를 묻는 비판적 시각이 빅데이터 시대의 필수 교양입니다.

융합개인정보를 지키며 데이터 쓰기 — 비식별화 기술

병원 진료 기록은 의학 연구에 보물이지만, 환자의 사생활 그 자체이기도 해요. 그래서 데이터를 쓰기 전에 누구의 것인지 알 수 없게 만드는 처리를 거칩니다.

  • 가명처리: 김민준 → 환자A (추가 정보 없이는 누군지 모르게)
  • 범주화: 17세 → 10대, 서울시 강남구 → 서울시
  • 총계처리: 개인 기록 대신 "평균 혈압 121" 같은 통계만 공개

🧪 비식별화 체험 — 버튼을 눌러 환자 데이터가 단계별로 어떻게 변하는지 보세요.

이름나이사는 곳혈압

재미있는 사실 — 미국의 한 연구에 따르면 우편번호 + 생년월일 + 성별, 단 세 가지만으로 미국인의 87%를 특정할 수 있었대요. 그래서 '이 정도면 익명이겠지'라는 감이 아니라, 법(개인정보 보호법)과 기술 기준에 따른 꼼꼼한 비식별화가 필요합니다.

진로공공데이터로 세상을 바꾼 사람들

여러분이 매일 쓰는 버스 도착 알림 앱의 시작은, 공공데이터로 앱을 만든 학생 개발자들이었어요. 지금도 공공데이터 활용 창업 경진대회에서는 학생들이 미세먼지 알림, 주차장 찾기, 전통시장 지도 같은 서비스를 만들어 실제 창업으로 이어 가고 있답니다.

관련 직업도 다양해요 — 데이터 엔지니어(데이터 수집·저장 시스템 구축), 데이터 분석가(데이터에서 인사이트 발굴), 시빅 해커(공공데이터로 사회 문제 해결). 진로 선택 과목 「데이터 과학」에서 이 길을 더 깊이 탐험할 수 있어요!

공공데이터탄생한 서비스활약하는 사람
버스 실시간 위치버스 도착 알림 앱데이터 엔지니어
대기오염 측정값미세먼지 알림 서비스데이터 분석가
상권·유동인구 통계창업 입지 분석 지도데이터 분석가·창업가
병원·약국 운영 정보심야 약국 찾기 지도시빅 해커
📌

한눈에 정리

  • 빅데이터 = 기존 방법으로 다루기 어려운 데이터 — 3V: 규모(Volume)·속도(Velocity)·다양성(Variety)
  • 생산지: 사람의 활동, 기계와 센서(IoT), 공공 기관, 기업 — 디지털 세상의 모든 곳
  • 수집 방법: 직접 수집 / 센서 수집 / 공공데이터 / 민간 데이터 — 문제에 맞게 선택
  • 수집의 출발점은 데이터가 아니라 문제 정의
  • 수집 전 3대 점검: 편향 · 개인정보 · 출처 신뢰성 — 기울어진 데이터는 기울어진 결론을 낳는다