대규모 영상·음성 학습데이터를 분석하는 인공지능 연구팀

연구팀이 멀티모달 학습데이터를 분석하는 모습. 사진은 AI 연구 현장을 재구성한 이미지.

정부가 발표한 독자 AI모델 학습데이터 개방 규모와 AI허브 이용 방법을 살펴봅니다. 현재 공개 목록, 데이터별 이용조건, 안심존 신청·승인 절차를 구분해 안내합니다.

과학기술정보통신부는 8월 27일 독자 인공지능 파운데이션 모델 프로젝트에서 구축한 학습데이터 29종, 3544만 건을 AI허브에서 무료 개방한다고 발표했습니다. 다만 정부가 발표한 규모와 실제 이용할 수 있는 최신 목록은 구분해야 합니다. 모든 자료가 곧바로 자유롭게 내려받을 수 있는 상태라는 뜻은 아닙니다.

정부 발표 규모와 실제 개방 목록은 구분

정부 발표에는 공개영상과 방송영상, 영상클립 기반 텍스트, 음성 질의응답 등 여러 형태의 데이터가 포함됐습니다. 네이버클라우드가 구축한 공개영상 234만 건, 방송영상 52만 건과 대규모 텍스트·음성 데이터 등 정예팀별 결과물의 개방 계획이 제시됐습니다.

대한민국 국민은 무료 이용

국내 기업과 연구기관, 대학생 등은 AI허브에서 회원 확인과 데이터별 절차를 거쳐 이용할 수 있습니다. 데이터마다 다운로드 방식과 승인 조건이 다를 수 있습니다.

상업 이용 조건은 데이터별 확인

무료 공개가 모든 용도의 무제한 사용을 뜻하지는 않습니다. 라이선스와 출처표시, 개인정보·초상권, 원본 재배포 제한을 데이터 설명서에서 확인해야 합니다. 방송영상 등 권리관계가 복잡한 자료는 안심구역에서만 이용하도록 제한될 수 있습니다.

중소기업의 구축비 부담 낮춰

대규모 학습데이터를 직접 수집하고 정제하려면 상당한 비용과 시간이 듭니다. 이번 공개는 자원이 부족한 스타트업과 연구팀이 한국어·멀티모달 AI를 시험할 기반을 넓힌다는 의미가 있습니다.

품질 검증은 이용자의 몫

공공데이터라도 편향과 중복, 라벨 오류 가능성을 점검해야 합니다. 실제 제품에 적용할 때는 별도의 품질평가와 개인정보 검토, 안전성 시험을 거치는 것이 필요합니다.

출처: 과학기술정보통신부 ‘AI 학습데이터 3544만 건 개방’

2026년 9월 6일 확인한 AI허브의 8월 31일 공지에는 18종이 표시돼 정부 발표의 29종과 차이가 있었습니다. 숫자가 다른 이유는 확인되지 않았습니다. 이용 전 해당 공지와 데이터별 페이지에서 최신 공개 목록, 접근 방법과 권리 조건을 확인해야 합니다. 안심존 데이터는 별도 신청과 승인이 필요합니다.

실제 개방 공지: AI허브 독자 AI모델 학습데이터 개방 안내

자료 확인: 2026년 9월 6일. 이후 세부 일정과 적용 조건은 해당 기관의 후속 공지를 확인해야 합니다.

대표 이미지는 기사 이해를 돕기 위한 제작 이미지이며, 실제 취재 현장 사진이 아닙니다.