범용 VLM 문서 파싱 파이프라인: DP-Bench TEDS·TEDS-S 최고점 후보
Gemini 3.6 Flash 기반 Consilience 문서 파싱 파이프라인의 단일 고정 실행이 최신 공개 DP-Bench 200문서에서 TEDS 96.34와 TEDS-S 98.41을 기록했습니다. 현재 등재 최고값을 각각 0.28점, 0.79점 넘었고 공식 등재를 요청했습니다.
- TEDS / TEDS-S · 단일 고정 실행 · n=200 · Discussion #6 등재 검토 중
- 96.34 / 98.41
- 전체 문서 성공 · 문서별 출력 선택이나 수동 수정 없음
- 200 / 200
결과: Consilience 문서 파싱 파이프라인의 단일 고정 실행은 최신 공개 DP-Bench 200문서 전체에서 TEDS 96.34, TEDS-S 98.41을 기록했다. 두 점수 모두 현재 벤치마크 표에 등재된 최고값을 넘었다.
상태: 공식 DP-Bench 저장소에 관리자 검토를 요청했다. 리더보드 등재는 진행 중이다.
2026년 8월 31일, 이 결과를 DP-Bench Discussion #6에 제출했다.
결과
최신 공개 scorer revision과 배포된 200문서 전체를 사용했다. 여러 번 실행한 뒤 최고점을 고른 것이 아니라 전체 데이터셋을 대상으로 한 번 고정 실행한 결과다. 200문서가 모두 성공했고, 문서별 출력을 골라 섞지 않았다.
| 지표 | Consilience | 현재 등재 최고값 | 차이 |
|---|---|---|---|
| TEDS · 표 구조와 내용 | 96.34 | 96.06 · Upstage standard | +0.28 |
| TEDS-S · 표 구조 | 98.41 | 97.62 · Upstage enhanced | +0.79 |
현재 공개 표에는 Upstage, AWS, Google, Microsoft의 서비스와 LlamaParse, Unstructured가 포함된다. 여기서 비교하는 범위는 TEDS와 TEDS-S다. DP-Bench는 하나의 종합 점수를 제공하지 않으므로 모든 지표를 합친 종합 순위로 읽어서는 안 된다.
내가 만든 것
기반 모델은 Google의 범용 모델 Gemini 3.6 Flash다. 이 모델을 직접 학습했거나 소유했다고 주장하지 않는다. 내가 만든 것은 그 바깥의 Consilience 시스템이다. PDF 입력, 추론 오케스트레이션, 구조화된 문서 표현, 벤치마크 스키마 변환, 재현 가능한 평가 하니스를 하나의 파이프라인으로 설계하고 구현했다.
문서 파싱에서 모델의 능력은 출발점일 뿐이다. PDF에서 실제로 쓸 수 있는 구조화 데이터까지 가는 동안 내용과 읽기 순서, 표 구조를 얼마나 온전히 보존하는지는 전체 시스템의 설계에 달려 있다.
검증과 주장 범위
후보는 전체 데이터셋에서 동일한 설정으로 평가했다. 추론 중 정답을 사용하지 않았고, 문서별로 출력을 골라 쓰지 않았으며, 실행 후 예측을 손으로 수정하지 않았다. 관리자 검증을 위한 측정 기록과 평가 산출물도 보존하고 있다.
이 결과가 정확히 뒷받침하는 주장은 다음과 같다.
최신 공개 DP-Bench revision에서 제출한 Consilience 후보는 TEDS 96.34와 TEDS-S 98.41을 기록해 현재 등재된 모든 행의 두 지표 점수를 상회한다. 공식 등재는 검토 중이다.
DP-Bench는 공개 문서 파싱 벤치마크이지 hidden test 방식의 OCR 대회는 아니다. 이 결과는 현재 공개 평가 규약에서의 성능을 보여주지만, 그 자체로 세계 최고의 OCR 모델이나 모든 미지의 문서 도메인에 대한 일반화를 증명하지는 않는다.
이 결과의 의미
범용 VLM을 기반으로 혼자 구축한 파이프라인이 두 표 인식 지표에서 현재 등재된 전문 문서 처리 서비스들을 넘어섰다. 내게 중요한 결과는 점수 두 개만이 아니다. 모델 선택만큼이나 문서 처리 전체 경계의 정교한 엔지니어링이 실제 성능을 좌우할 수 있다는 증거다.
무엇을 측정한 것인가
- Consilience
지식그래프를 바탕으로 코딩·디자인·질의를 수행하는 범용 AI 에이전트입니다. 파견 엔지니어 없이 문서에서 온톨로지를 구축하고 관리합니다.