독파모 AI허브 3544만 건 데이터 무료 개방 — 스타트업·개발자·연구자 활용 완전 가이드
안녕하세요! 하나팁 열매입니다 🍎😊 AI 개발자라면 놓쳐선 안 될 초대형 뉴스를 들고 왔어요. 오늘은 독파모 AI허브 3544만 건 공공 데이터 무료 개방 — 스타트업·개발자·연구자 활용 가이드를 준비했습니다. 정부가 AI 학습용 공공 데이터를 무려 3544만 건이나 AI허브(aihub.or.kr)에서 무료로 개방했어요.
규모 감이 안 오신다면 이렇게 생각하세요. 토큰 환산 시 약 1조 5600억 토큰, 매개변수 700억~800억 개 규모 대형 AI 모델을 처음부터 학습시킬 수 있는 분량입니다. 국내 빅테크 5개사가 쌓은 프리미엄 데이터를 스타트업이든 대학원생이든 무료로 쓸 수 있게 됐다는 뜻이에요.
독파모란? 데이터 개방 배경부터
'독파모'는 '독자 AI 파운데이션 모델'의 줄임말로, 과학기술정보통신부와 한국지능정보사회진흥원(NIA)이 2024년부터 추진한 국책사업입니다. ChatGPT·Gemini 같은 외산 AI에 의존하지 않고 한국이 자체 기반 모델을 갖겠다는 프로젝트예요.
5개 정예팀(네이버클라우드·업스테이지·SK텔레콤·NC AI·LG AI연구원)을 선발해 경쟁 방식으로 진행했고, 2026년 1차 평가에서 네이버클라우드·NC AI가 탈락, 2차 평가로 업스테이지·SKT·LG 3파전이 됐습니다. 핵심은 탈락팀 데이터도 국내 AI 생태계에 환류한다는 설계 — 참여 조건이 구축 데이터의 50% 이상 공개였거든요.
이번 29종 3544만 건은 1차 평가 과정에서 5개 팀이 2025년 150억 원 예산으로 만든 결과물입니다. NIA·한국정보통신기술협회(TTA)의 품질·개인정보·유해성 검증까지 끝난 상태라 바로 쓸 수 있어요.
29종 데이터 상세 — 기업별 무엇을 개방했나
멀티모달(텍스트·영상·음성·이미지), 도메인 특화 추론, 로봇 학습용 물리 데이터, 안전성 검증 레드티밍까지 AI 개발 거의 모든 단계의 재료가 망라됐습니다.
| 기업 | 주요 데이터 | 규모 |
|---|---|---|
| 네이버클라우드 | 영상·텍스트·음성 Q&A | 영상 286만 + 텍스트 1550만 + 음성 1200만 건 |
| 업스테이지 | 사전학습·에이전트 사후학습 | 1조 토큰 + 에이전트 50만 건 |
| SK텔레콤 | 전문 추론·한국형 레드티밍 | 수학·과학·법률 + 레드티밍 1만 건 |
| NC AI | 제조·의료·민원 현장 | 실제 산업 7종 |
| LG AI연구원 | 가정 가사 영상·로봇 이미지 | 50개 가정 영상 17만 + 이미지 15만 2000건 |
AI허브 다운로드 방법 — 단계별 정리
대부분 신청 후 자동 승인되어 당일 다운로드가 가능합니다. 한 번만 해두면 이후엔 훨씬 편해요.
1단계: 회원가입 및 본인 인증
aihub.or.kr 접속 → 회원가입 → 휴대폰 인증. 반드시 대한민국 국민이어야 무료 이용이 가능합니다.
2단계: 데이터 검색
'데이터 찾기' 메뉴에서 15개 분야별 검색, 또는 '독자AI모델 데이터' 카테고리로 이번 개방분을 한 번에 봅니다.
3단계: 다운로드 신청 · 4단계: CLI(aihubshell)
데이터셋 페이지 [다운로드] 버튼 → 이용 목적 간단 기재 → 자동 승인. 대용량은 aihubshell CLI로 서버에서 바로 받으세요. aihubshell -mode l로 목록, -mode d -datasetkey [번호]로 특정 셋을 내려받아 전처리 파이프라인까지 한 번에 연결됩니다.
안심존 — 보안 데이터 접근이 필요할 때
일부는 개인정보·민감 정보를 포함해 '안심존'으로만 이용 가능합니다. 2026년 8월엔 방송영상 AI 학습데이터 안심존도 정식 개방됐어요.
온라인 안심존은 보안 네트워크로 원격 접속해 분석, 오프라인 안심존은 지정 물리 공간에서만 접근. 의료처럼 민감도 높은 데이터일수록 오프라인이 요구됩니다.
안심존 신청 필수 서류
- 기관생명윤리위원회(IRB) 심의 결과 통지서
- IRB 승인 연구계획서
- 소속 증빙(재직·재학·근로계약서 중 택 1)
- 안심존 이용 신청서 · 보안서약서
독자 유형별 활용 전략
스타트업은 NC AI의 제조·의료·민원 현장 데이터로 도메인 특화 파인튜닝을 하면 범용 LLM보다 훨씬 정확한 서비스를 만들 수 있어요. B2B라면 SKT 한국형 레드티밍으로 유해 응답을 사전 테스트하세요. 상업적 이용은 수행기관과 별도 협의가 필요합니다.
개발자는 업스테이지 1조 토큰으로 한국어 기반 모델 프리트레이닝, 네이버클라우드 영상·음성으로 멀티모달 파이프라인을 짤 수 있습니다. 연구자는 논문에 '한국지능정보사회진흥원 사업 결과물' 출처 명시가 의무이며, LG의 가정 로봇 데이터·SKT 수학·과학·법률 추론셋은 국제 학술지에서도 희귀한 자원이에요.
이용 정책 체크리스트 — 놓치면 낭패
무료지만 조건 없는 무료가 아닙니다. 아래를 꼭 확인하세요.
- ☐ 출처 명시: '한국지능정보사회진흥원 사업 결과물' 표기 필수
- ☐ 이용 목적: AI 모델 학습용만 가능, 데이터 자체 판매 금지
- ☐ 상업적 이용: 영리 제품·서비스는 수행기관 별도 협의
- ☐ 제3자 제공 금지: 데이터 양도·판매 불가
- ☐ 개인정보: 재식별 금지, 발견 시 즉시 신고
- ☐ NIA 실태조사 요청 시 성실 응대
위반 시 민·형사 책임이 발생할 수 있으니, 스타트업이 서비스에 데이터를 얹기 전 NIA에 상업적 이용 가능 여부부터 확인하시길 강력 권장합니다.
지금 바로 aihub.or.kr에 접속해 회원가입하고 '독자AI모델 데이터' 카테고리를 즐겨찾기에 추가하세요. 2차 평가에서 확보되는 데이터도 순차 개방 예정이니, 새 데이터가 올라올 때마다 바로 신청해 프로젝트에 적용하시길 바랍니다! 🍎
#독파모 #AI허브 #공공데이터 #AI학습데이터무료 #3544만건 #aihub #스타트업AI #LLM데이터 #AI파운데이션모델 #과기정통부
© https://hana-tip.com
댓글
댓글 쓰기