KOLongDoc: https://github.com/Marker-Inc-Korea/KOLongDoc
GitHub - Marker-Inc-Korea/KOLongDoc: Long Korean Document을 위한 VLM 벤치마크
Long Korean Document을 위한 VLM 벤치마크. Contribute to Marker-Inc-Korea/KOLongDoc development by creating an account on GitHub.
github.com
Dataset: https://huggingface.co/datasets/Markr-AI/KOLongDoc
Markr-AI/KOLongDoc · Datasets at Hugging Face
We’re on a journey to advance and democratize artificial intelligence through open source and open science.
huggingface.co
Introduction😋
긴 한국어 공공문서에 대한 VLM 능력 평가를 위한 multi-hop VQA 벤치마크 제작기🔥

안녕하세요! 오랜만에 인사드리는 kyujinpy 입니다! 다들 잘 지내고 계신가요!?
최근에 멀티모달과 RAG에 대한 관심이 높아지면서, 공공업무나 행정업무에 ChatGPT, Claude와 같은 AI가 많이 도입되기 시작했습니다.😎
이러한 흐름에 따라, 해외에는 긴 문서나 복잡한 문서에 대한 여러 벤치마크가 등장하고 있지만 여전히 국내에서는 이러한 데이터셋 및 벤치마크가 부족한 상황입니다.🥲
기존 한국어 VLM의 성능을 측정하기 위한 벤치마크들은 여러가지 목적으로 공개가 되었습니다.🧐🧐
- KO-VQA: 한국어 문서 기반 이해 능력 평가
- KO-VDC:한국어 문서 기반 표/도식/그래프에 대한 적절한 설명문 생성 능력 평가
- KO-OCRAG: 고해상도 한국어 문서*OCR 능력 및 문서에 존재하는 visual information에 대한 text description 생성 능력 평가
- KOFFVQA: 한국어 이미지 기반 객관적이고 신뢰성 있게 평가하기 위한 free-form VQA 평가
- KoViDoRe: 한국어 시각 **문서** retrieval 능력 평가
- K-MMBench and K-MMStar: 한국어 기반 이미지에 대한 다양한 시각 이해 및 추론 능력 평가
- K-DTCBench: 한국어 이미지 기반 표·차트 이해 능력을 다양한 형식(디지털 및 손글씨)에서 이해 능력 평가
- K-LLAVA-W: 한국어 이미지 기반 실생활 기반 시각 이해 및 질의응답 능력을 평가
위와 같이 다양한 데이터 형식과 이미지/문서를 기반으로 한국어 능력을 평가하고자 하는 움직임은 있었지만, 길이가 긴 고해상도 한국어 문서에 대한 multi-hop VQA를 종합적으로 고려한 데이터셋은 없었습니다.⚠️
✨따라서 저희는 KOLongDoc📄라는 복잡하고 긴 고해상도 한국어 문서에 대한 VLM 벤치마크를 소개합니다.✨
이를 위해, 저희는 한국어 공공기관 문서를 공공데이터포털에서 수집한 후, multi-hop question and answering 문제를 제작하였습니다.😎
KOLongDoc 벤치마크는 총 200문항으로 구성되어 있으며, 복잡한 추론, multi-page understanding, 그리고 long-document understanding에 대한 한국어 능력을 평가할 수 있습니다.⭐
KOLongDoc가 한국어 벤치마크 및 한국어 멀티모달 모델 평가에 큰 도움이 될 것이라고 생각합니다!🤗
Details of Dataset
KOLongDoc는 총 100개의 문서를 🌟매우 다양한 도메인🌟에서 수집하였습니다.
각 문서들은 총 2가지 type의 문서들로 구분이 되고, 각 문서마다 2개의 multi-hop QA 문항을 구성하였습니다.
- Long document: 60 페이지 미만의 문서들 구성되며, 136문항으로 구성됨. (68개의 문서)
- Super Long document: 60 페이지 이상의 문서들로 구성되며, 64문항으로 구성됨. (32개의 문서)
각 문서들에서 multi-hop QA 문항을 제작한 방법은 다음과 같습니다:
- Gemini를 활용하여 통해 각 문서마다 question과 answer를 자동으로 생성합니다.🤖
- Human verification을 통해, 각 문항의 난이도와 multi-QA 여부를 확인하고, 질문의 퀄리티 향상 및 올바른 답변으로 수정하는 과정을 수행합니다.🧐
- 마지막으로, 정확한 정량적 평가를 위해서 정답으로 인정되기 위해서 필수적으로 담겨야하는 `keyword`를 인간이 직접 선별하는 과정을 수행합니다.🧐
완성된 데이터셋의 예시는 아래와 같습니다:
| Document name: 인천 해양수질측정망 운영 결과(2024년 3분기).pdf Question: 붙임 3'의 퇴적물 조사 결과에서 구리 농도가 가장 높은 정점과 아연 농도가 가장 높은 정점의 이름을 각각 찾고, 두 정점 중 총유기탄소(TOC) 함량이 더 낮은 정점의 이름과 그 TOC(%) 값은 무엇인가? Answer: 구리는 '강화주문도 선착장 앞', 아연은 '영종도 동방' 입니다. TOC 함량이 낮은 것은 '강화주문도 선착장 앞' 이며, 0.458이다. Keyword: ['강화주문도 선착장', '영종도 동방', 0.458] |
| Document name: 인사혁신처_국가공무원인재개발원 교육운영계획_20260310.pdf Question: '영어권 장기국외훈련자과정' 및 '디지털역량교육과정 (3일)'을 수강하고 싶은데, 교육비는 얼마나 들까요? (숫자는 전부 적어주세요. 예시로, 100000원.) 그리고 주변에 국내 A회사에 다니는 공무원 친구가 집에서 재택근무를 하고 시간이 많다는데, 2개의 강좌를 동시에 들을 수 있을까요? ('가능' 또는 '불가능'이라고 답해주세요.) Answer: 850000, 불가능 Keyword: [850000, '불가능'] |
KOLongDoc 데이터셋을 통해, 한국어 LLM 및 해외 LLM 등등 다양한 평가를 통해 long multi-page QA에 대한 성능을 평가할 수 있을 것이라고 기대합니다🔥🔥.
Evaluation
기존 VLM이나 LLM의 주관식 평가는 BERT-Score, LLM-as-a-judge와 같이 pretrained model의 prior를 활용해서 측정이 되었습니다. 하지만 해당 평가 방식들은 pretrained model에 의존하며 long-context generation일수록 성능이 부정확하다는 단점이 있습니다🧐🧐.
그래서 저희는 데이터셋에 정의된 Keyword 변수를 통해서 모델 평가를 `Accuracy`를 기반으로 구성했습니다.🔥
모델 답변 안에서 `Keyword`에 해당하는 단어들이 얼마나 들어가 있는지 비율을 토대로 평가를 진행하게 됩니다.
예시는 다음과 같습니다🤗:
| Question: 붙임 3'의 퇴적물 조사 결과에서 구리 농도가 가장 높은 정점과 아연 농도가 가장 높은 정점의 이름을 각각 찾고, 두 정점 중 총유기탄소(TOC) 함량이 더 낮은 정점의 이름과 그 TOC(%) 값은 무엇인가? Gemini Answer: 제공된 문서의 '붙임 3. 해양수질측정망 해저퇴적물 조사 결과(2024년 3분기)'(15~16페이지)를 바탕으로 분석한 결과는 다음과 같습니다. 1. **구리(Cu) 농도가 가장 높은 정점:** - 정점 21 (강화주문도 선착장 앞): 223.94 mg/kg으로 가장 높습니다. 2. **아연(Zn) 농도가 가장 높은 정점:** - 정점 17 (만석부두 앞): 91.99 mg/kg으로 가장 높습니다. 3. **총유기탄소(TOC) 함량 비교:** - 정점 21(강화주문도 선착장 앞)의 TOC: 0.458 % - 정점 17(만석부두 앞)의 TOC: 0.928 % 두 정점 중 TOC 함량이 더 낮은 곳은 **정점 21(강화주문도 선착장 앞)**이며, 해당 값은 **0.458 %**입니다. Keyword: ['강화주문도 선착장', '영종도 동방', 0.458] Accuracy: 약 66.6% |
| Question: '영어권 장기국외훈련자과정' 및 '디지털역량교육과정 (3일)'을 수강하고 싶은데, 교육비는 얼마나 들까요? (숫자는 전부 적어주세요. 예시로, 100000원.) 그리고 주변에 국내 A회사에 다니는 공무원 친구가 집에서 재택근무를 하고 시간이 많다는데, 2개의 강좌를 동시에 들을 수 있을까요? ('가능' 또는 '불가능'이라고 답해주세요.) Gemini Answer: 질문에 대한 답변은 다음과 같습니다. **1. 교육비** * **제공된 문서에서는 해당 내용을 찾을 수 없습니다.** * 문서에 따르면 '영어권 장기국외훈련자과정'의 교육비는 14일 기준 **700000원**으로 명시되어 있으나, 3일만 수강할 경우의 비용 산정 기준은 나와있지 않습니다. 또한, '디지털역량교육과정'은 수십 개의 세부 과정(과정별 **100000원** 또는 **150000원**)으로 나뉘어 있어 어떤 과정을 수강하는지 특정할 수 없기 때문에 정확한 교육비 합산이 불가능합니다. **2. 동시 수강 가능 여부** * **불가능** * 해당 친구가 공무원 신분이라고 가정하더라도 두 과정을 동시에 수강하는 것은 불가능합니다. 1. '영어권 장기국외훈련자과정'의 교육대상은 일반 공무원이 아닌 **'영어권 장기국외훈련 파견 공무원'**으로 엄격히 제한되어 있습니다. 2. 두 과정 모두 지정된 연수원 등에서 오프라인으로 참석해야 하는 **'집합'** 교육 방식으로 진행되므로, 집에서 재택근무를 하며 동시에 수강할 수 없습니다. Keyword: [850000, '불가능'] Accuracy: 50% |
위와 같은 평가 시스템을 기반으로 총 2가지 버전의 성능평가 테이블을 공유합니다:
- `Hard` Version: 0 or 1로 평가하는 방법. (100% 정확도만을 정답으로 인정)
- `Soft` Version: 0~1 사이로 평가하는 방법.
그리고 document input type에 따른 모델 능력을 비교하기 위해서 다음과 같이 평가를 진행됩니다:
- text: `pymuPDF` 모듈을 활용하여, 텍스트를 전부 추출한 후 모델에 전달
- image: PDF를 이미지 형식으로 모델에 전달
추가적으로 모델별로 long document와 super long document에 대한 성능을 각각 구분해서 제공했습니다!
- `L-Acc`: Long document에 대한 정확도 (60 페이지 미만)
- `SL-Acc`: Super Long document에 대한 정확도 (60 페이지 이상)
모든 평가는 max_token length 8192와 한 개의 A100 80GB GPU를 활용해서 수행했습니다!
자세한 평가는 Github 코드를 참고해주세요!
Results (Hard version)

저희는 Closed-model로 Gemini를 적극적으로 평가하였고, Open-source model에서 해외 VLM으로 Qwen/Gemma와 국내 VLM으로 EXAONE/Gukbap/VARCO/Bllossom을 평가를 했습니다!
먼저 only image-input에 대한 평가입니다!
최근에 나온 Gemini-3.5-flash가 82.58%로 가장 높은 점수에 달성했습니다!
반면 오픈소스 모델들은 high-resolution multiple images를 잘 이해하지 못하는 편이었습니다.
그리고 80GB라는 높은 GPU 사양에도 불구하고, OOM이 굉장히 잘 발생하거나 inference 시간이 너무 길어서 성능 측정이 어려운 경우가 많았습니다😭😭
Qwen3.6-27B 모델은 현재 시점에 SoTA에 근접한 VLM 모델임에도 불구하고, 정확도가 5.19%에 불가했습니다.
오히려 gemma-4가 상대적으로 더 좋은 성능을 보였으며,
더 좋은 GPU로 gemma-4-31B 나 국내 VLM으로 가장 각광받고 있는 EXAONE-4.5-33B 모델들을 평가해보고 싶은 마음이 들었습니다!

그 다음은 only-text input에 대한 평가입니다!
최근에 나온 Gemini-3.5-flash가 76.76%로 가장 높은 점수에 달성했습니다! Image input에 비해서는 성능이 낮았지만 그래도 여전히 준수한 성능을 보였습니다!
Text-based 평가에서는, 오픈소스 모델들도 준수한 성능을 보여줬습니다!
Qwen3.6-27B 모델은 L-Acc에서 79.08%로 가장 높은 성능을 보였으며,
Qwen3.5-9B는 전체 성능이 70.94%로 준수한 성능을 보여주었습니다.
그럼에도 불구하고, 많은 모델들이 80GB 안에서 long document에 담긴 text description을 다 받아들이지 못하여, OOM이 발생했습니다 😭😭
기회가 된다면, OOM이 발생한 모델들에 대하여 지속적으로 벤치마크 성능을 업데이트할 계획입니다!
*Soft version에 대한 평가는 Github를 참고해주세요!
저희가 공개한 벤치마크는 국내외 VLM들이 복잡하고 긴 한국어 공공문서에 대해
얼마나 잘 이해하고 있고, 모델 내부 추론 능력으로 얼마나 정확하게 정답을 도출 해낼 수 있는지에 대하여 측정할 수 있습니다!
앞으로도 국내 VLM 발전을 위한 벤치마크 및 연구를 지속적으로 해보겠습니다.
긴 글 읽어주셔서 감사합니다!!
References
[LongDocURL](https://arxiv.org/abs/2412.18424)
[공공데이터포털](https://www.data.go.kr/)
*평가를 위한 GPU/API key 지원 및 성능 결과 공유는 언제든지 환영합니다!✨
2026.05.30. Kyujinpy 작성.
- 많은 관심과 공유 부탁드립니다! ㅎㅎ
'AI > LLM project' 카테고리의 다른 글
| [KO-VLM-Benchmark Datasets 공개🤗] - 한국어 VLM 평가를 위한 3가지 벤치마크 데이터셋 (0) | 2026.01.25 |
|---|---|
| [KO-VQA 벤치마크 제작기🤗] 시각화자료질의응답 데이터셋을 활용한 한국어 VLM 능력 평가 벤치마크 (3) | 2025.07.07 |
| [Gukbap-LMM🍚] - 오직 텍스트 데이터셋만으로 한국어 기반 LMM 제작하기 (0) | 2025.02.23 |
| [다양한 한국어 LLM 벤치마크 평가 코드🍚] - 단 하나의 코드로 N개의 LLM 벤치마크 구현하기 (0) | 2024.11.14 |
| [Gukbap-LLM🍚] - 오픈소스 LLM으로 자체 데이터셋 생성해서 SOTA 달성하기 (8) | 2024.11.14 |