Deep Learning 주요 데이터셋 정리 (2026년 기준)
01 Nov 2021 | CNN Paper Review ImageNet목차
- 표를 읽는 방법
- 1. 언어 모델의 사전학습과 후속 학습
- 2. 언어 모델의 지식·수학·추론 평가
- 3. 이미지 분류·검출·분할
- 4. 이미지·언어 모델과 문서 이해
- 5. 동영상·행동·시간적 이해
- 6. 음성·오디오
- 7. 추천·그래프·표·시계열
- 8. 3D·자율주행·로보틱스
- 9. 의료 데이터의 대표 자원
- 10. 목적에 맞게 조합하는 방법
- 11. 작은 표본부터 내려받는 예시
딥러닝 데이터셋은 사전학습, 지시 수행 학습, 성능 평가 등 용도에 따라 구분한다. 평가 문제와 풀이가 학습 자료에 포함되면 평가 점수에 암기 효과가 반영될 수 있다. 이미지·음성·추천 데이터에서도 학습 자료와 평가 자료의 중복이 일반화 성능 측정에 영향을 준다.
2026년 9월 6일을 기준으로 공개 모델의 학습 자료, 주요 평가 도구가 지원하는 벤치마크, 분야별 비교 실험에 쓰이는 데이터셋을 정리했다. 각 표의 데이터셋 이름은 제작 기관의 프로젝트, 데이터 카드 또는 원 논문으로 연결된다. 규모는 해당 행에 적은 버전의 공개 수치다. 실제 다운로드 수량은 배포본과 원본 파일의 접근 가능 여부에 따라 달라진다.
최근 활용 여부는 Language Model Evaluation Harness, VLMEvalKit, MTEB, SWE-bench의 지원 과제와 공식 학습 데이터 카드를 참고했다. 오래된 데이터셋도 기존 연구의 재현과 비교에 쓰이면 포함했다. 목록은 용도별로 분류했으며 사용량 순위는 매기지 않았다.
표를 읽는 방법
| 표기 | 의미 | 실험에서 지켜야 할 구분 |
|---|---|---|
| 사전학습 | 대규모 원문·이미지·음성에서 일반적인 표현을 학습한다. | 평가 문항 및 그 해설과 중복되는 자료를 제거한다. |
| SFT·선호학습 | 지시문에 대한 응답이나 응답 간 선호도를 학습한다. | 합성 응답을 만든 모델, 선호 판정 방식, 원자료의 이용 조건을 기록한다. |
| 학습·평가 | 공식 train/validation/test 분할을 제공한다. | 학습에는 train을 사용하고, 모델 선택에는 validation을 사용한다. |
| 평가 | 지식·추론·검색·작업 수행 능력을 측정한다. | 공개된 정답이 있더라도 최종 비교용 문항을 학습에 넣지 않는다. |
| 모음·환경 | 여러 데이터셋의 묶음이거나 실행 가능한 평가 환경이다. | 하위 데이터셋, 버전, 실행 조건을 함께 고정한다. |
K, M, B, T는 각각 천, 백만, 십억, 조 단위다. 토큰 수는 토크나이저에 따라 달라지며, 문서 수·이미지 수·질문 수·평가 실행 횟수는 서로 다른 단위다. 라이선스 칸은 이용 시 확인할 핵심 사항을 요약한다. 특히 데이터 모음의 라이선스가 포함된 모든 원문·사진·코드의 권리를 일괄 부여하지는 않는다.
1. 언어 모델의 사전학습과 후속 학습
1.1 사전학습 코퍼스
| 데이터셋 | 구분 | 용도와 확인한 규모·버전 | 접근·라이선스·선택 시 유의점 |
|---|---|---|---|
| FineWeb | 사전학습 | Common Crawl에서 정제한 영어 웹 문서다. 초기 공개는 15T 토큰이며 확인한 데이터 카드는 확장본을 18.5T 토큰 이상으로 설명한다. | ODC-BY-1.0이며 웹 원문의 권리는 별도로 확인한다. 전체 대신 표본·수집 시기별 구성을 선택할 수 있다. |
| FineWeb-Edu | 사전학습 | FineWeb에서 교육적 내용을 선별한 1.3T 토큰 코퍼스다. | ODC-BY-1.0이다. 별도 score-2 배포본의 5.4T 토큰과 혼동하지 않는다. 교육성 점수의 필터 기준도 실험 조건이다. |
| FineWeb2 | 사전학습 | 비영어권을 중심으로 1,000개 이상 언어를 다룬다. 공식 카드에는 1,868개 언어·문자 조합이 기재되어 있다. | ODC-BY-1.0이다. 언어별 유효 문서량 차이가 크며 removed 자료와 정제본을 구분한다. 작은 test 분할은 학습에서 제외한다. |
| Dolma · OLMo-mix-1124 | 사전학습 | OLMo 계열의 재현 가능한 웹·논문·코드 등 혼합 자료다. Dolma v1.7의 전체 집계는 OLMo 토크나이저 기준 약 2.31T 토큰이다. | ODC-BY 계열 배포이며 하위 자료의 조건을 확인한다. Dolma의 초기 3T 소개 수치와 v1.7에서 실제 학습에 샘플링한 약 1.72T를 구분한다. |
| DCLM-baseline-1.0 | 사전학습 | DataComp-LM의 영어 웹 데이터 선별 기준을 재현하는 코퍼스다. | 공개 카드의 이용 조건과 원문 권리를 확인한다. 정제·중복 제거 방법을 비교하는 실험에 사용한다. |
| The Stack v2 | 사전학습 | Software Heritage를 바탕으로 구축한 다국어 코드 자료다. StarCoder2 계열의 학습 데이터 구성과 연결된다. | 접근 조건과 삭제 요청 절차가 있다. 파일별 라이선스 정보를 보존하고, 라이선스 미검출 파일을 자동으로 허용된 코드로 취급하지 않는다. |
FineWeb-Edu는 교육적 영어 텍스트의 학습 비중을 높이는 데, FineWeb2는 다국어 비중을 조절하는 데 사용할 수 있다. Dolma·OLMo 혼합물은 공개 모델의 학습 구성을 재현할 때 사용한다.
1.2 지시 수행, 대화, 선호학습
| 데이터셋 | 구분 | 용도와 확인한 규모·버전 | 접근·라이선스·선택 시 유의점 |
|---|---|---|---|
| UltraChat 200k | SFT | 정제한 합성 다중 턴 대화로 지시 수행을 학습한다. train_sft 등 용도별 분할을 제공한다. |
데이터 카드의 MIT 표기와 생성 원천의 조건을 확인한다. 이름의 200k를 모든 분할을 합친 행 수로 해석하지 않는다. |
| UltraFeedback Binarized | 선호학습 | chosen과 rejected 응답 쌍을 이용하는 DPO 등의 실험에 쓴다. train_prefs는 약 61K 행이다. |
카드에는 MIT가 명시되어 있다. 원본 다중 후보 평가와 이진화한 응답 쌍은 서로 다른 자료다. |
| Tülu 3 SFT Mixture | SFT | 일반 대화·수학·코딩·안전성 등을 혼합한 939,344개 표본이다. Tülu 3 학습에 사용되었다. | 모음은 ODC-BY-1.0이지만 일부 하위 데이터는 비상업용이다. source 필드를 유지하고, 상업적 사용 시 하위 데이터별로 확인한다. |
| Arena Human Preference 140k | 선호학습·분석 | 실제 사용자 대화에서 두 모델을 비교한 투표 자료다. 확인한 카드에는 135,634행이 있다. | 사용자 프롬프트는 CC-BY-4.0이며 모델 출력에는 각 제공자의 조건이 적용된다. 같은 평가 세션의 대화를 서로 다른 분할에 넣지 않는다. |
합성 지시문 데이터는 사람이 검수한 정답 집합과 다르다. 특히 수학·코딩 응답은 실행기나 정답 검증기로 추가 확인하고, 선호 데이터에서는 무승부·둘 다 나쁨·응답 길이 편향을 별도로 처리해야 한다.
2. 언어 모델의 지식·수학·추론 평가
| 데이터셋 | 구분 | 평가하는 능력과 규모·버전 | 접근·비교 시 유의점 |
|---|---|---|---|
| MMLU | 평가 | 57개 과목의 객관식 지식을 평가한다. 오래된 결과와의 비교 기준으로 유용하다. | 공개 문제·코드를 제공한다. 학습 오염과 높은 점수대의 포화 가능성을 고려하고, 과목별 평균 방식과 few-shot 조건을 기록한다. |
| MMLU-Pro | 평가 | 14개 분야, 12K개 이상의 문제로 지식과 추론을 평가한다. 선택지를 늘리고 문제를 재검토했다. | 공식 저장소·데이터 카드를 사용한다. MMLU와 문항·선택지 구성이 달라 점수를 직접 치환할 수 없다. |
| GPQA | 평가 | 대학원 수준의 과학 질문을 평가한다. main, extended, diamond 등 구성을 제공한다. |
공식 배포의 접근 동의와 오염 방지 안내를 따른다. 평가 결과에는 선택한 구성을 명시한다. |
| GSM8K | 학습·평가 | 초등 수준 다단계 산술 문제 7,473개 train, 1,319개 test로 구성된다. | MIT로 배포된다. 최종 숫자 추출 규칙을 고정한다. 높은 점수만으로 고급 수학 능력을 주장하기 어렵다. |
| MATH · MATH-500 | 학습·평가 | MATH는 경시 수학 12,500문제이며 train 7,500개, test 5,000개다. MATH-500은 평가용 500문제 부분집합이다. | 원 문제의 권리와 배포 상태를 확인한다. 전체 test와 MATH-500 결과를 구분하고, 식의 동치 판정 규칙을 고정한다. |
| AIME 연도별 문제 | 평가 | 미국 수학 경시대회의 정수 답안 문제로 추론 성능을 평가한다. 시험지당 15문제다. | MAA의 문제 이용 조건을 확인한다. AIME 2024, AIME 2025처럼 연도와 시험지를 명시하며, 제3자 변환본의 라이선스 표기만으로 원문 권리를 판단하지 않는다. |
| BIG-Bench Hard | 평가 | 논리·기호 조작·언어 추론 등 23개 과제를 묶었다. | 공식 프롬프트와 답 추출 규칙을 함께 사용한다. CoT 사용 여부가 다르면 동일한 평가 조건이 아니다. |
| Humanity’s Last Exam | 평가 | 여러 전문 분야의 어려운 문제를 다루며 이미지 문제도 포함한다. 2025년 확정 공개본은 2,500문제다. | 공개본과 비공개 평가를 구분한다. HLE-Rolling은 수정되는 별도 버전이므로 revision을 기록하고, 도구 사용·검색 허용 여부도 명시한다. |
| LiveBench | 평가 | 수학·코딩·추론·언어·지시 수행 등을 주기적으로 갱신한 문제로 측정한다. | 평가 릴리스 날짜를 고정한다. 새로운 문제를 추가하더라도 해당 모델의 학습에 없었다는 사실이 자동으로 보장되지는 않는다. |
MMLU·GSM8K·MATH의 문제와 풀이는 인터넷 문서나 합성 학습 데이터에 포함될 수 있다. 문제 공개일과 모델의 학습 기간을 대조하면 오염 가능성을 점검할 수 있다. 사내 도메인 문제와 비공개 평가는 공개 벤치마크의 문항과 다른 자료에서 성능을 측정하는 데 사용한다.
코딩·지시 수행·에이전트
| 데이터셋·환경 | 구분 | 평가하는 능력과 규모·버전 | 접근·비교 시 유의점 |
|---|---|---|---|
| HumanEval · EvalPlus | 평가 | HumanEval의 164개 함수 완성과 EvalPlus의 강화된 HumanEval+·MBPP+ 테스트로 생성 코드의 기능을 검사한다. | 공개 코드·자료를 제공한다. 생성 코드는 격리된 실행 환경에서 검증한다. 원본과 강화 테스트의 pass@k는 구분한다. |
| LiveCodeBench | 평가 | 경진대회 문제를 시간 순서에 따라 추가하며 코드 생성·실행·수정 능력을 평가한다. | 릴리스와 문제 수집 기간을 함께 고정한다. 원 대회 문제의 이용 조건, 실행 시간 제한, 언어 버전을 확인한다. |
| SWE-bench | 평가·환경 | 실제 저장소 이슈를 코드 수정으로 해결하는 능력을 측정한다. Verified는 사람이 검토한 500개 과제, Lite는 300개 과제다. | 공식 컨테이너와 테스트를 사용한다. 모델뿐 아니라 에이전트 구현, 도구, 시도 횟수, 비용을 기록한다. 원 저장소 라이선스도 적용된다. |
| IFEval | 평가 | 단어 수, 필수 표현, 형식 등 프로그램으로 확인 가능한 지시 준수를 평가한다. | 공개 검사기를 사용한다. strict/loose와 instruction/prompt 수준 점수는 서로 다른 지표다. |
| GAIA | 평가 | 검색·파일 이해·계산·도구 결합이 필요한 일반 비서 과제다. | 배포본 접근 조건이 있다. validation과 비공개 test를 구분하고, 사용한 검색·브라우저·파일 도구를 명시한다. |
| WebArena | 평가·환경 | 쇼핑·게시판·코드 저장소 등 웹 환경에서 여러 단계를 수행한다. | 데이터만 받는 것으로 실행되지 않으며 사이트 환경을 구성해야 한다. 브라우저 상태·초기 데이터·환경 버전을 고정한다. |
| OSWorld | 평가·환경 | 실제 데스크톱 애플리케이션을 조작해 작업을 완수하는 능력을 측정한다. | VM 이미지와 앱 환경이 필요하다. 원 OSWorld와 후속 Verified 설정, 최대 단계 수, 평가 스크립트를 구분한다. |
| ARC-AGI-2 · ARC-AGI-3 | 평가·환경 | ARC-AGI-2는 격자 변환 규칙의 일반화, ARC-AGI-3는 상호작용하며 환경의 규칙을 알아내는 능력을 평가한다. | 공개 연습 자료와 비공개 평가를 구분한다. ARC-AGI-3는 2026년 평가 환경이므로 정적인 문제 파일처럼 다루지 않으며, 행동 효율과 실행 조건을 함께 기록한다. |
SWE-bench·WebArena·OSWorld의 점수에는 모델과 에이전트 실행 조건이 함께 반영된다. 같은 모델이라도 접근 가능한 도구, 컨텍스트 관리, 재시도 횟수, 테스트 실행 정책에 따라 결과가 달라진다. 성공률과 과제당 비용·지연 시간·실패 유형을 함께 기록하면 실행 조건에 따른 차이를 비교할 수 있다.
긴 문맥·검색·한국어
| 데이터셋·모음 | 구분 | 평가하는 능력과 규모·버전 | 접근·비교 시 유의점 |
|---|---|---|---|
| LongBench · LongBench v2 | 평가 | 긴 문서의 질의응답·요약·추론을 평가한다. v1과 v2는 문제 구성과 평가 형식이 다르다. | 공식 버전을 명시한다. 모델의 입력 한도, 문서 절단 방식, 답변 토큰 예산을 함께 기록한다. |
| RULER | 평가·생성기 | 길이를 조절한 합성 문맥으로 검색·추적·집계 능력을 평가한다. | 생성 seed와 토크나이저를 고정한다. 단순 needle 검색 통과를 실제 장문 이해 능력으로 일반화하지 않는다. |
| MS MARCO | 학습·평가 | 실제 검색 질의에 대한 passage·document 검색과 순위화를 다룬다. | 공식 이용 조건을 따른다. passage v1, v2, document 설정을 구분하고, negative 구성과 후보 집합을 명시한다. |
| BEIR · MTEB | 평가 모음 | BEIR는 여러 도메인의 검색 일반화, MTEB는 검색·분류·군집·유사도 등 임베딩 과제를 묶는다. | 하위 데이터셋마다 라이선스가 다르다. 버전·언어·과제 목록을 고정하며, 전체 모음의 평균과 retrieval-only 점수를 구분한다. |
| KLUE | 학습·평가 | 개체명 인식, 문장 관계, 독해 등 한국어 이해 8개 과제를 제공한다. | 과제별 데이터와 라이선스를 확인한다. 생성형 모델의 한국어 종합 능력 전체를 대신하는 평가로 해석하지 않는다. |
| KMMLU | 학습·평가 | 한국의 실제 시험에서 수집한 45개 과목의 객관식 문제다. test는 35,030개이며 train도 별도로 존재한다. | CC-BY-ND-4.0으로 안내된다. 영어 MMLU 번역본이 아니며, 제공된 train을 학습했는지와 test 구성을 명시한다. |
| HAE-RAE Bench | 평가 | 한국어 어휘·문화·맥락 지식을 평가한다. | 공식 배포의 라이선스와 과제 구성을 확인한다. 번역 지식 평가만으로 놓치는 한국 특유의 맥락을 보완한다. |
| AI-Hub | 데이터 카탈로그 | 한국어 음성·대화·문서와 비전·산업 분야의 개별 데이터셋을 제공한다. | 단일 데이터셋이 아니다. 로그인·신청·다운로드 도구와 개별 이용 조건을 확인하고, 실제 사용한 데이터명·구축 연도·세부 버전을 기록한다. |
3. 이미지 분류·검출·분할
| 데이터셋 | 구분 | 용도와 확인한 규모·버전 | 접근·라이선스·선택 시 유의점 |
|---|---|---|---|
| ImageNet | 학습·평가 | ImageNet-1K의 1,000개 클래스는 이미지 분류와 시각 표현의 기본 비교에 사용된다. | 공식 접근 절차와 연구용 이용 조건을 확인한다. 1K와 전체 ImageNet, 정제·재수집 변형을 구분한다. |
| CIFAR-10 · CIFAR-100 | 학습·평가 | 각각 60K개의 32×32 이미지로 구성된다. 작은 모델·증강·최적화 실험에 적합하다. | 제작자 페이지에서 직접 받을 수 있다. 작은 이미지에서 얻은 순위를 고해상도 문제의 성능으로 해석하지 않는다. |
| COCO | 학습·평가 | 객체 검출·인스턴스 분할·키포인트·캡셔닝을 제공한다. 검출에서는 COCO 2017의 80개 클래스 설정을 구분해 쓴다. | annotation과 원 이미지의 이용 조건이 다르다. 2014/2017 분할, test-dev, 캡셔닝의 Karpathy split을 혼용하지 않는다. |
| Open Images V7 | 학습·평가 | 이미지 수준 레이블, 박스, 마스크, 시각 관계 등으로 더 넓은 객체 어휘를 다룬다. | annotation과 개별 이미지의 라이선스를 각각 확인한다. 과제별로 레이블이 존재하는 이미지 수가 다르다. |
| ADE20K | 학습·평가 | 장면의 픽셀 단위 의미 분할에 사용된다. 일반적인 Scene Parsing Benchmark는 150개 클래스를 평가한다. | 전체 ADE20K와 파생 Scene Parsing 분할을 구분한다. 전체 데이터는 등록과 이용 약관 동의가 필요하다. |
| Cityscapes | 학습·평가 | 도시 주행 장면의 정밀·거친 주석으로 의미 분할과 장면 이해를 평가한다. | 등록과 연구용 이용 조건이 있다. fine/coarse 주석, 평가 클래스, 해상도 설정을 함께 적는다. |
| LVIS | 학습·평가 | COCO 이미지를 기반으로 긴 꼬리 분포의 객체 인스턴스 분할을 다룬다. | annotation 버전과 COCO 이미지 권리를 확인한다. 전체 AP와 희귀 클래스 AP를 함께 보고한다. |
| SA-1B | 사전학습·학습 | 11M 이미지와 1.1B 마스크로 클래스에 종속되지 않는 분할을 학습한다. | 연구용 제한 라이선스가 적용된다. 마스크에는 의미 클래스가 없으며, 모델 코드의 라이선스와 데이터 라이선스는 다르다. |
분류는 top-1/top-5, 검출·인스턴스 분할은 AP, 의미 분할은 mIoU 등 과제에 맞는 지표를 사용한다. SA-1B의 마스크는 객체 영역을 제공하며 ADE20K의 픽셀 주석은 의미 클래스도 제공한다. 주석 개수를 비교할 때에는 이러한 학습 신호의 차이를 구분한다.
4. 이미지·언어 모델과 문서 이해
4.1 이미지·텍스트 학습 자료
| 데이터셋 | 구분 | 용도와 확인한 규모·버전 | 접근·라이선스·선택 시 유의점 |
|---|---|---|---|
| LAION-5B | 사전학습 | 약 5.85B개의 이미지·텍스트 쌍 메타데이터로 이미지·텍스트 정렬과 생성 연구에 쓰였다. | 원 이미지를 모두 재배포하는 자료가 아니다. URL 생존 여부, 원 이미지 권리, 유해 콘텐츠 필터와 현재 배포 상태를 확인한다. |
| DataComp | 사전학습·평가 모음 | 동일한 학습 예산에서 이미지·텍스트 자료의 선별 방법을 비교한다. | 데이터 pool, 규모 구간, 학습 횟수와 평가 과제를 고정한다. 원 이미지의 라이선스는 별도로 확인한다. |
| OBELICS | 사전학습 | 이미지와 문장이 교차 배치된 웹 문서로 멀티모달 문맥을 학습한다. | CC-BY-4.0과 원 콘텐츠 조건이 적용되며 모델·응용 공개 시 사용 사실 공개 조건이 있다. 단일 이미지·캡션 쌍과 구조가 다르다. |
| LLaVA 학습 자료 | SFT | 이미지 기반 질의응답과 지시 수행 학습을 재현한다. 158K 초기 지시 자료와 1.5의 665K 혼합 자료 등을 구분한다. | 코드와 원 이미지·질의응답·합성 출력의 이용 조건을 각각 확인한다. 평가용 데이터의 train 부분이 섞일 수 있다. |
| PixMo-Cap | 사전학습·SFT | 사람이 이미지를 설명한 전사문을 바탕으로 긴 캡션을 만들었다. Molmo 학습에 사용되며 확인한 배포본은 717,042행이다. | ODC-BY-1.0이며 생성 출력의 별도 조건이 있다. 이미지는 URL로 제공되므로 따로 확보해야 한다. |
| Docmatix | SFT | 문서 이미지에 대한 합성 질의응답으로 문서 이해를 학습한다. 이미지 포함·텍스트 중심 구성을 구분한다. | 카드에는 MIT가 명시되어 있다. 원 문서 권리와 OCR·합성 답변의 오류 가능성을 확인한다. |
4.2 시각 질의응답·OCR·도표 평가
| 데이터셋 | 구분 | 용도와 확인한 규모·버전 | 접근·비교 시 유의점 |
|---|---|---|---|
| VQAv2 | 학습·평가 | COCO 이미지 약 205K개, 질문 약 1.1M개로 시각 질의응답을 다룬다. | 이미지 권리와 질문 주석의 이용 조건을 확인한다. 한 질문에 여러 정답이 있으며 공식 VQA 점수 정규화를 사용한다. |
| GQA | 학습·평가 | 장면 그래프를 바탕으로 객체 관계와 조합적 추론을 다룬다. 전체 생성 질문은 약 22M개다. | 전체 질문과 balanced subset의 규모·분포가 다르다. 이미지와 주석의 조건을 각각 확인한다. |
| MMMU | 평가 | 다양한 전문 분야의 이미지·도표·텍스트를 함께 이해하는 능력을 평가한다. | 공식 split과 후속 MMMU-Pro를 구분한다. 외부 지식과 시각 추론이 동시에 필요하므로 오류 유형을 나누어 분석한다. |
| MMBench | 평가 | 여러 시각 인지·추론 능력을 객관식 문제로 평가한다. 영어·중국어, dev/test 등 구성을 제공한다. | 공식 배포본과 VLMEvalKit 평가 설정을 맞춘다. 선택지를 순환시키는 CircularEval과 답변 선택지 추출기를 사용했는지 기록한다. |
| MME | 평가 | 인지·추론 능력을 여러 하위 과제의 예/아니요 질문으로 평가한다. | 공식 데이터 신청·평가 안내를 따른다. perception/cognition 합산 점수와 문항별 정확도를 구분한다. |
| MathVista | 평가 | 도형·그래프·표 등의 시각 정보를 사용한 수학 추론을 평가한다. | testmini와 전체 test를 구분한다. 답 추출·단위·반올림과 판정 모델 사용 여부가 점수에 영향을 준다. |
| DocVQA | 학습·평가 | 단일 문서 이미지에서 정보를 찾아 답하는 과제를 제공한다. | 다운로드·평가 서버 이용 조건을 확인한다. ANLS 등의 공식 지표와 Single/Multiple Page 과제를 구분한다. |
| OmniDocBench | 평가 | 다양한 PDF 페이지에서 본문·수식·표·읽기 순서를 복원하는 문서 파싱을 평가한다. 공식 저장소의 2026년 4월 갱신은 v1.7이다. | 데이터 릴리스와 평가 코드 버전을 맞춘다. 일부 질문의 정답만 찾는 DocVQA와 달리 문서 전체 구조의 복원 품질을 측정한다. |
| ChartQA | 학습·평가 | 차트의 수치·범례를 읽고 산술·논리 질의에 답한다. | 사람이 작성한 질문과 생성한 질문의 부분집합을 구분한다. 수치 답변의 허용 오차를 공식 평가에 맞춘다. |
| OCRBench | 평가 | 글자 인식, 장면·문서 질의응답, 수학식 인식 등 OCR 관련 능력을 묶어서 평가한다. | 원 OCRBench와 후속 버전을 구분한다. 하위 데이터의 이용 조건과 평가 시 이미지 해상도를 확인한다. |
| TextVQA | 학습·평가 | 간판·상품 포장 등 이미지 안의 글자를 읽어야 답할 수 있는 질의응답이다. | 원 논문에서 공식 자료 경로를 확인한다. OCR 토큰을 별도로 입력한 모델과 이미지 입력만 사용한 모델을 구분한다. |
| ST-VQA | 학습·평가 | 장면 속 문자를 읽고 그 내용으로 질문에 답하는 과제다. | 원 논문과 공식 challenge의 다운로드·평가 조건을 따른다. TextVQA와 같은 데이터셋이 아니며 어휘 제공 설정도 확인한다. |
| TextCaps | 학습·평가 | 이미지 속 글자의 의미까지 반영한 설명 문장을 생성한다. | 이미지와 캡션의 이용 조건을 확인한다. 글자만 전사하는 OCR 과제가 아니므로 문장 품질과 내용 정확성을 함께 평가한다. |
TextVQA·ST-VQA·TextCaps는 모두 문자를 포함한 이미지를 다루지만 출력 목표가 다르다. 앞의 두 자료는 질문의 정답을, TextCaps는 이미지 설명 문장을 요구한다. 기존 배포 사이트에 접근할 수 없다면 원 논문과 제작자의 후속 안내에서 배포 경로를 확인한다. 미러를 사용할 경우에는 원본의 버전·분할·이용 조건과 일치하는지 확인한다.
5. 동영상·행동·시간적 이해
| 데이터셋 | 구분 | 용도와 확인한 규모·버전 | 접근·라이선스·선택 시 유의점 |
|---|---|---|---|
| Kinetics | 학습·평가 | 짧은 클립의 행동 분류를 다룬다. Kinetics-400/600/700의 클래스 수와 분할이 다르다. | 주석·URL 배포와 원 영상의 권리를 구분한다. 삭제된 영상 때문에 실제 확보 수가 달라지므로 다운로드 성공 목록을 남긴다. |
| Something-Something V2 | 학습·평가 | 물체 조작의 시간적 차이를 다룬다. 174개 레이블, 총 220,847개 영상이며 train 168,913개, validation 24,777개다. | 공식 다운로드와 라이선스 절차를 따른다. 정적 배경보다 동작 순서가 중요하며 공식 test 레이블은 공개되지 않는다. |
| ActivityNet | 학습·평가 | 긴 비디오의 행동 분류와 시간 구간 검출을 다룬다. 버전과 challenge 과제에 따라 구성이 다르다. | 공식 코드와 CVPR 2015 원 논문을 참고한다. 행동 주석과 별도로 공개된 ActivityNet Captions를 같은 자료로 취급하지 않는다. |
| HowTo100M | 사전학습 | 1.2M개의 설명 영상에서 얻은 136M개 클립·자막 쌍이다. 절차 학습과 텍스트·비디오 정렬에 활용한다. | 자막은 약한 감독 신호이며 행동과 정확하게 맞지 않을 수 있다. URL·자막·특징과 원 영상 권리를 구분한다. |
| YouCook2 | 학습·평가 | 89개 요리 종류, 2,000개 긴 영상에서 단계별 시간 구간과 설명을 제공한다. | 원 영상의 삭제·차단과 공식 배포 상태를 확인한다. 동일 영상의 여러 클립을 train/test에 나누어 넣지 않는다. |
| YFCC100M | 사전학습·자료 모음 | Flickr의 약 99.2M 사진과 0.8M 영상 및 메타데이터다. 대규모 멀티미디어 연구의 기존 비교 자료다. | 항목마다 Creative Commons 조건이 다르다. 전체가 동영상 100M개인 자료가 아니며 현재의 원본 확보 가능성을 별도로 확인한다. |
| EPIC-KITCHENS | 학습·평가 | 주방의 1인칭 영상에서 동사·명사·행동 인식과 행동 예측을 다룬다. 55/100 등 배포본을 구분한다. | 공식 등록·이용 조건을 확인한다. 촬영자·주방 단위 분할을 명시하고, 학습에 없는 환경의 성능을 구분해 보고한다. |
| Ego4D | 학습·평가 | 1인칭 일상 영상으로 기억·미래 예측·상호작용·시청각 이해를 다룬다. | 별도 이용 동의가 필요하다. 전체 영상과 과제별 주석의 버전을 맞추고 개인정보 관련 사용 조건을 따른다. |
| MVBench | 평가 | 동작 순서·상태 변화·행동 추론 등 여러 시간적 이해 과제를 묶었다. | 하위 원본 영상의 조건을 확인한다. 평가 프레임 수와 샘플링 간격을 고정한다. |
| Video-MME | 평가 | 다양한 길이와 주제의 비디오에서 멀티모달 이해를 평가한다. | 자막 있음/없음, 오디오 사용 여부, 프레임 수와 최대 길이를 구분한다. 입력 정보가 다른 결과를 같은 조건으로 비교하지 않는다. |
| SA-V | 학습·평가 | 약 51K개의 영상과 643K개의 시간축 마스크 묶음인 masklet을 제공한다. 비디오 객체 분할에 사용한다. | CC-BY-4.0이다. 연구용 제한이 있는 SA-1B와 라이선스를 혼동하지 않는다. 의미 클래스가 없는 객체 마스크 자료다. |
비디오 데이터의 규모에는 원본 영상 수와 추출 클립 수가 각각 사용된다. HowTo100M은 원본 영상 1.2M개에서 얻은 클립·자막 쌍 136M개를 제공한다. 자막을 입력하는 모델은 시각 정보와 텍스트를 함께 사용하므로, 평가 결과에는 자막 사용 여부를 명시한다.
6. 음성·오디오
| 데이터셋 | 구분 | 용도와 확인한 규모·버전 | 접근·라이선스·선택 시 유의점 |
|---|---|---|---|
| LibriSpeech | 학습·평가 | 영어 낭독 음성의 ASR 기준 자료다. 학습 분할은 100h·360h·500h이며 16kHz 음성을 제공한다. | CC-BY-4.0이다. test-clean/test-other의 WER를 따로 보고하고 학습한 시간 규모를 명시한다. |
| LibriTTS | 학습·평가 | 약 585시간의 다화자 영어 음성을 24kHz로 제공한다. 문장 단위 TTS 학습에 적합하다. | CC-BY-4.0이다. LibriSpeech와 원천 자료가 겹치므로 서로 독립된 평가 자료로 가정하지 않는다. |
| Common Voice | 학습·평가 | 여러 언어·화자의 참여형 음성 자료다. 언어별 수집량과 검수량이 다르다. | 2025년부터 Mozilla Data Collective를 통한 배포로 이동했다. 기본 CC0 표기와 별도로 배포 플랫폼 조건을 확인하며 릴리스·언어·validated 시간을 기록한다. |
| FLEURS | 학습·평가 | 102개 언어의 낭독 음성으로 다국어 ASR·음성 번역·언어 식별을 다룬다. | CC-BY-4.0으로 안내된다. 언어별 설정과 텍스트 정규화 규칙을 고정하고, 다른 번역 자료와의 문장 중복을 확인한다. |
| AudioSet | 학습·평가 | 약 2M개의 10초 클립과 527개 소리 범주를 사용하는 다중 레이블 소리 인식 자료다. | 주석과 원 YouTube 음원의 권리를 구분한다. balanced/unbalanced와 평가 분할, 실제 확보한 클립 수를 기록한다. |
| ESC-50 | 학습·평가 | 50개 환경음 범주, 2,000개 5초 클립으로 소리 분류를 평가한다. | 전체 자료는 CC-BY-NC-3.0이다. 공식 5-fold 분할을 유지하고, 같은 원음에서 나온 클립을 임의 분할하지 않는다. |
| VoxCeleb | 학습·평가 | 인터뷰 음성으로 화자 식별·검증을 다룬다. VoxCeleb1/2와 평가 trial 목록을 구분한다. | 공식 접근 안내와 음원 이용 조건을 확인한다. 학습·평가 자료를 화자 단위로 분리하고, 화자 검증에는 EER·minDCF 등의 지표를 사용한다. |
| WavCaps | 사전학습·학습 | 약 400K개의 음원·캡션 쌍으로 오디오·언어 검색과 캡셔닝을 학습한다. | 공식 저장소는 학술·연구 목적만 허용한다고 명시한다. Freesound·BBC 등 원천별 조건을 확인하고 합성 캡션 오류도 점검한다. |
ASR의 WER, 화자 검증의 EER, 환경음 분류의 accuracy/mAP, TTS의 청취 평가는 서로 대체할 수 없다. 샘플레이트와 채널 수뿐 아니라 화자 중복, 녹음 장치, 잡음 환경도 분할과 결과 해석에 영향을 준다.
7. 추천·그래프·표·시계열
| 데이터셋·모음 | 구분 | 용도와 확인한 규모·버전 | 접근·라이선스·선택 시 유의점 |
|---|---|---|---|
| MovieLens | 학습·평가 | 평점 예측과 순위 추천을 다룬다. 공식 페이지는 새 연구에 32M 고정 배포본을 추천한다. 1M·20M·25M도 기존 연구 비교에 쓰인다. | GroupLens 이용 조건을 따른다. latest는 변하므로 고정 버전을 사용하고 사용자·아이템 수와 필터링을 기록한다. |
| Amazon Reviews 2023 | 학습·평가 | 리뷰·평점·상품 메타데이터로 순차 추천, 텍스트 기반 추천, cold-start를 다룬다. | 공식 배포 조건과 상품·리뷰의 원천 권리를 확인한다. 카테고리·k-core·시간 분할을 명시한다. |
| Criteo 1TB Click Logs | 학습·평가 | 광고 클릭 예측과 대규모 희소 특징의 임베딩 학습에 사용한다. | 공식 연구용 이용 조건을 확인한다. 더 작은 Kaggle 배포본과 구분하고, 날짜 분할·범주 해싱 방식을 기록한다. |
| Open Graph Benchmark | 학습·평가 모음 | 노드·링크·그래프 예측 과제를 공식 로더·분할·평가기와 함께 제공한다. | 데이터셋마다 라이선스가 다르다. ogbn-arxiv, ogbl-collab, ogbg-molhiv처럼 정확한 과제 ID를 명시한다. |
| UCI Repository · OpenML | 데이터 카탈로그·평가 모음 | 표 데이터의 분류·회귀와 AutoML 비교에 사용할 여러 자료를 제공한다. | 개별 데이터셋 라이선스를 확인한다. OpenML의 dataset ID와 task ID, 버전·fold를 기록하고 전체 포털을 하나의 데이터셋처럼 적지 않는다. |
| RelBench | 학습·평가 모음 | 여러 테이블의 관계와 시간 정보를 이용하는 예측 과제를 다룬다. | 데이터베이스별 이용 조건과 공식 분할을 확인한다. 예측 시점 이후의 행이 조인·집계에 들어가지 않도록 한다. |
| ETT | 학습·평가 | 변압기 부하·유온 등의 시계열을 제공한다. ETTh1/2는 시간 단위, ETTm1/2는 15분 단위로 사용된다. | 공식 CSV·라이선스를 확인한다. 예측 길이, 다변량 여부, 시간 분할을 고정하고 scaler는 학습 구간에만 맞춘다. |
| Monash Forecasting Repository | 학습·평가 모음 | 여러 도메인과 빈도의 시계열을 비교한다. M4·전력·교통 등 개별 자료로 접근할 수 있다. | 하위 데이터의 라이선스와 표준 평가 구간을 따른다. 시계열 개수와 관측값 수를 구분한다. |
| GIFT-Eval | 평가 모음 | 원 논문 기준 23개 데이터셋, 144K개 이상의 시계열로 범용 예측 모델을 평가한다. | 하위 자료·주파수·예측 길이별 설정을 고정한다. 학습 중 보지 않은 자료인지 확인하고 공식 평가 코드를 사용한다. |
| Chronos Datasets | 사전학습 자료 모음 | 여러 시계열 자료를 묶어 Chronos 계열 학습 구성을 재현한다. | 하위 자료의 원 라이선스를 확인한다. GIFT-Eval·Monash 등의 평가 자료와 겹치는지 데이터셋 이름과 원천까지 대조한다. |
추천 문제에서 무작위로 interaction을 나누면 같은 사용자의 미래 행동을 먼저 학습할 수 있다. cold-start를 연구한다면 사용자나 아이템 자체가 학습에 없도록 나누고, 시간에 따른 추천을 연구한다면 시간 분할을 사용해야 한다. 그래프에서도 미래에 생긴 간선이나 전체 그래프에서 계산한 특징이 입력에 섞이는지 확인한다.
8. 3D·자율주행·로보틱스
| 데이터셋·모음 | 구분 | 용도와 확인한 규모·버전 | 접근·라이선스·선택 시 유의점 |
|---|---|---|---|
| ScanNet | 학습·평가 | 실내 RGB-D 스캔으로 3D 의미·인스턴스 분할과 장면 이해를 다룬다. | 데이터 이용 약관 동의와 접근 절차가 있다. ScanNet v2와 ScanNet200 등 레이블 구성을 구분하고 장면 단위로 분할한다. |
| Objaverse · Objaverse-XL | 사전학습·학습 | 대규모 3D 객체 자산으로 생성·표현·렌더링 연구를 수행한다. XL은 여러 출처를 확장한 자료다. | 객체별 라이선스가 다르다. 메타데이터와 실제 파일의 권리를 구분하고, 다운로드·렌더링 성공률과 중복 자산을 확인한다. |
| nuScenes | 학습·평가 | 카메라·LiDAR·레이더로 3D 검출·추적·예측 등을 다룬다. | 비상업용 데이터 이용 조건과 공식 접근 절차를 확인한다. 전체 데이터, mini, lidarseg 등 과제별 배포를 구분한다. |
| Waymo Open Dataset | 학습·평가 | Perception·Motion 등 센서 인지와 도로 사용자 궤적 예측 자료를 제공한다. | 별도 데이터 이용 약관이 적용된다. 데이터 종류와 릴리스, 센서 좌표계·주석 주기를 명시한다. |
| Argoverse 2 | 학습·평가 | Sensor·LiDAR·Motion Forecasting 자료로 주행 장면 이해와 예측을 다룬다. | 공식 라이선스·다운로드 안내를 따른다. AV1/AV2, 지도 버전, 예측 horizon을 구분한다. |
| KITTI | 학습·평가 | 스테레오·깊이·광류·검출·주행 거리 추정 등의 기존 표준 비교 자료다. | 과제별 다운로드와 비상업용 조건을 확인한다. 적은 지역·날씨에서 수집된 결과를 전체 주행 환경으로 일반화하지 않는다. |
| Open X-Embodiment | 학습 자료 모음 | 여러 기관·로봇에서 얻은 실제 로봇 demonstration을 공통 형식으로 묶는다. | 하위 데이터별 라이선스가 다르다. 관측·행동 좌표계, 로봇 종류, 제어 주기를 통일하기 전에 원 정의를 확인한다. |
| DROID | 학습 | 여러 장소에서 수집한 실제 로봇 조작 궤적을 제공한다. 시각·언어·행동 모델 학습에 활용한다. | 공식 데이터 접근·이용 조건을 확인한다. 성공/실패 궤적, 장면·수집자 분할, 실제 로봇 평가 조건을 기록한다. |
로봇 데이터의 행동 벡터는 차원 수가 같아도 의미가 다를 수 있다. 데이터를 결합할 때에는 절대 위치와 상대 이동량, 카메라와 로봇의 좌표계, gripper 값의 방향을 일치시켜야 한다. 오프라인 행동 예측 오차와 실제 로봇의 작업 성공률은 별도로 평가한다.
9. 의료 데이터의 대표 자원
| 데이터셋 | 구분 | 용도와 확인한 규모·버전 | 접근·라이선스·선택 시 유의점 |
|---|---|---|---|
| MIMIC-IV v3.1 | 학습·평가용 원자료 | 비식별화한 병원·중환자실 기록으로 임상 예측과 시계열 연구를 수행한다. | PhysioNet 자격 인증·교육·데이터 이용 동의가 필요하다. 환자 단위 분할과 시점 정의를 연구자가 설정해야 하며, 승인되지 않은 서비스로 원자료를 전송하지 않는다. |
| MIMIC-CXR-JPG v2.1.0 | 학습·평가 | 흉부 X-ray JPG와 구조화 레이블로 이미지 분류·의료 멀티모달 연구를 수행한다. | 접근 인증과 이용 동의가 필요하다. 판독문은 관련 MIMIC-CXR 배포를 확인하고, 영상·검사·환자 ID의 관계를 유지한다. |
| CheXpert | 학습·평가 | 흉부 X-ray 분류와 불확실 레이블 처리를 다룬다. | 공식 데이터 사용 계약을 확인한다. uncertain 레이블을 0·1·제외 중 무엇으로 처리했는지 명시하고 환자 중복을 막는다. |
| MedMNIST v2 | 학습·평가 모음 | 12개 2D, 6개 3D 의료 이미지 자료를 통일된 형식으로 제공해 작은 모델과 파이프라인을 비교한다. | 하위 자료별 라이선스를 확인한다. 공식 페이지는 임상 사용 목적이 아님을 명시하며, 축소 이미지 성능을 임상 적합성으로 해석하지 않는다. |
의료 데이터는 이미지 수와 함께 환자·검사·기관 수를 기록한다. 같은 환자의 여러 촬영을 무작위로 나누면 학습 자료와 평가 자료에 동일한 환자가 포함될 수 있다. 환자 단위 분할은 이런 중복을 줄이며, 외부 병원과 다른 시기의 자료를 이용한 평가는 기관·시기에 따른 성능 변화를 측정한다.
10. 목적에 맞게 조합하는 방법
| 연구 목적 | 시작할 자료 | 함께 확인할 평가 조건 |
|---|---|---|
| 소형 영어 LLM의 데이터 정제 | FineWeb 표본, FineWeb-Edu, DCLM | 같은 토큰 예산에서 비교하고 MMLU-Pro·GSM8K 등의 오염 여부를 확인한다. |
| 한국어 LLM·임베딩 | FineWeb2 한국어 자료, 조건에 맞는 AI-Hub 자료 | KLUE·KMMLU·HAE-RAE와 실제 도메인 질의를 함께 평가한다. |
| 수학·코딩 모델 | 검증 가능한 SFT 자료와 별도 train split | MATH-500·연도별 AIME·LiveCodeBench의 문제 날짜와 추론 예산을 고정한다. |
| 문서·차트 이해 | Docmatix, DocVQA train, ChartQA train | DocVQA·ChartQA·OCRBench를 공식 분할로 평가하고 해상도를 기록한다. |
| 영상의 시간적 이해 | SSv2, EPIC-KITCHENS, 목적에 맞는 영상·자막 자료 | MVBench·Video-MME에서 프레임 수·오디오·자막 조건을 맞춘다. |
| 새 상품 추천 | Amazon Reviews, MovieLens의 아이템 정보 | 아이템 cold-start와 시간 분할을 분리하고 Recall@K·NDCG@K를 보고한다. |
| 범용 시계열 모델 | 이용 조건에 맞는 Chronos·Monash 하위 자료 | GIFT-Eval의 평가 원천이 학습에 포함되었는지 먼저 대조한다. |
비교 실험의 결과에는 학습량, 전처리, 분할, negative sampling, 프롬프트, 도구 접근 권한, 판정기가 영향을 준다. 여러 seed에서 얻은 결과나 bootstrap 신뢰구간은 점수의 변동성을 나타내며, 평가 자료가 작을 때에는 이러한 변동이 특히 클 수 있다.
학습 오염과 중복을 점검하는 순서
- 공식 test 문항과 정답·해설을 학습 자료에서 제외한다. URL이 다르더라도 복사된 문서와 번역본이 있을 수 있다.
- 텍스트는 정규화한 exact match와 n-gram·MinHash 등의 근사 중복 검사를 함께 사용한다. 자동 제거 기준은 표본 검수로 확인한다.
- 이미지·영상·음성은 파일 해시뿐 아니라 원본 ID, 지각적 유사도, 화자·촬영 세션·영상 ID를 함께 확인한다.
- 추천·시계열·의료 자료는 사용자·아이템·환자·장면·시간 중 실제 배포 상황에 맞는 단위로 나눈다.
- 정규화 통계, 어휘 사전, PCA, imputer와 같은 전처리는 학습 분할에서만 추정한다. 검색 평가에서 제공된 전체 검색 코퍼스를 색인하는 것은 허용될 수 있으므로 과제 프로토콜과 구분한다.
- 모델 선택을 위해 반복해서 본 validation 결과와 최종 test 결과를 구분하고, 수정되는 벤치마크는 commit·release를 고정한다.
11. 작은 표본부터 내려받는 예시
다음 예시는 기준일에 확인한 Hugging Face Datasets의 로딩 문서, 스트리밍 문서, Hub의 HfApi 문서에 따른다. 실행 확인에 사용한 버전은 datasets 4.8.5, huggingface_hub 1.30.0이다. 설치 명령은 패키지 버전을 고정하고, 각 Python 예시는 데이터의 commit SHA를 출력한다.
python3 -m venv .venv-datasets
source .venv-datasets/bin/activate
python -m pip install datasets==4.8.5 huggingface_hub==1.30.0
python -m pip freeze > requirements-datasets-resolved.txt
GSM8K의 학습 표본 확인
최초 실행에서는 Hub의 현재 commit을 조회한다. 출력한 commit 값을 실험 기록에 저장하고, 재현할 때에는 dataset_info()를 다시 호출하는 대신 그 값을 revision에 지정한다.
from datasets import load_dataset
from huggingface_hub import HfApi
dataset_id = "openai/gsm8k"
revision = HfApi().dataset_info(dataset_id).sha
sample = load_dataset(
dataset_id,
"main",
revision=revision,
split="train[:5]",
)
print({"dataset": dataset_id, "revision": revision, "split": "train[:5]"})
print(sample.column_names)
print(sample[0]["question"])
print(sample[0]["answer"])
train[:5]는 반환할 행을 제한한다. 저장 형식에 따라 원격 shard나 전체 분할을 먼저 내려받을 수 있으므로, 전송량은 다섯 행의 크기보다 클 수 있다. 위 예시는 작은 GSM8K 자료에 사용한다.
FineWeb-Edu를 스트리밍으로 확인
from datasets import load_dataset
from huggingface_hub import HfApi
dataset_id = "HuggingFaceFW/fineweb-edu"
revision = HfApi().dataset_info(dataset_id).sha
stream = load_dataset(
dataset_id,
name="sample-10BT",
revision=revision,
split="train",
streaming=True,
)
print({"dataset": dataset_id, "revision": revision, "config": "sample-10BT"})
for row in stream.take(3):
print(row["text"][:200])
스트리밍은 전체 데이터셋을 로컬 저장소에 받지 않고 순차적으로 읽는 방법이다. 그래도 파일 메타데이터나 압축 블록은 전송될 수 있다. take(3)은 형식 확인용이며, 코퍼스 전체의 분포를 대표하는 무작위 표본은 아니다. 학습에 사용할 때에는 shuffle buffer, seed, worker별 shard 분할과 실제 읽은 표본 수를 기록한다.
위 환경에서 GSM8K 5행과 FineWeb-Edu 3행의 반환을 확인했다. FineWeb-Edu 스트리밍은 표본 출력 후 프로세스 종료가 지연되어 정상 종료까지는 확인하지 못했다.
실험 기록에 남길 항목
| 항목 | 기록 예시 |
|---|---|
| 출처 | 공식 프로젝트 URL, Hub dataset ID, 데이터 카드의 확인 날짜를 적는다. |
| 버전 | release·commit SHA·다운로드 파일 checksum을 적는다. |
| 구성 | config 이름, split, 실제 사용 행 수, 제외한 표본 수를 적는다. |
| 변환 | 텍스트 정규화, 이미지 크기, 음성 샘플레이트, 프레임 샘플링을 적는다. |
| 분할 | 시간·환자·사용자·장면 등 분할 단위와 seed를 적는다. |
| 이용 조건 | 원 데이터·annotation·합성 출력의 라이선스와 필요한 접근 승인을 보관한다. |
| 평가 | 지표, 공식 평가 코드 commit, 프롬프트, 판정기, 도구·추론 예산을 적는다. |
공식 데이터 카드나 링크가 유지되어도 원본 파일은 삭제될 수 있다. 논문에는 배포 당시의 공개 규모와 실제 확보·학습·평가한 규모를 구분해 기록한다.