조영탁
연구 기록
측정 결과를 전문으로 정리했습니다. 무엇과 대조했는지, 검정 결과가 무엇이었는지, 무엇을 보여주지 못하는지까지 적었습니다. 부정 결과와 재현 실패, 측정한 뒤 되돌린 변경도 함께 있습니다.
-
기법
밀집 검색의 허브 문제를 2010년 거리 집중 이론으로 진단하고, 교차언어 임베딩의 보정을 이식하다
직관적인 대안 세 가지를 먼저 시도해 측정으로 전부 기각한 뒤, 다른 분야에서 해법을 가져와 추가 API 비용 없이 검색 정확도를 올렸습니다. 규모를 300배로 늘려 다시 측정했을 때 드러난 손실과 그 수리까지 함께 적었습니다.
- 77.5 → 97.0 밀집 시딩 recall@10 — 같은 조건의 키워드 검색은 85.2
- $0 추가 API 비용 · end-to-end 답변 정확도 87% → 97%
-
기법
반증 라운드가 있는 결함 감사 — 후보 45개에서 재현 가능한 14개까지
의심 사례를 실행 가능한 재현으로 바꾸고, 각 결함마다 통제군을 붙이고, 독립 회의론자가 전부 반증을 시도한 뒤 남은 것만 결함으로 인정했습니다. 가장 큰 발견은 계획에 없던 것이었고, 실제 설치본을 읽었기 때문에 나왔습니다.
- 45 → 14 후보에서 재현 가능한 결함으로 · 반증 라운드 통과 14/14
- 102,020 감사가 찾아낸 무증상 데이터 손실 쿼드 수 — 수정 후 회귀 테스트 등록
-
벤치마크
문서 파싱 벤치마크 두 개 — 하나는 1위, 하나는 중위권, 그리고 그 차이의 원인
전용 파인튜닝 파서가 아니라 범용 VLM에 프롬프트만 얹은 구성으로 DP-Bench 표 구조에서 1위를 기록했습니다. 같은 파이프라인이 OmniDocBench에서는 중위권이며, 진 이유와 벤치마크 분류가 만든 측정 아티팩트를 문서 49개까지 내려가 규명했습니다.
- 98.11 DP-Bench 표 구조 TEDS-S — 공식 리더보드 1위
- 79.23 같은 파이프라인의 OmniDocBench Table-TEDS — 상위권은 93.42
-
기법
더 많이 추출해도 검색은 움직이지 않는다 — 부정 결과와, 재현되지 않은 유의성
픽스처에서 확인됐던 이득이 3,002노트 볼트에서 재현되는지 페어드 A/B로 측정했습니다. 결론은 부정이었고, 부분적으로 관측된 이득은 두 번째 독립 실행에서 유의성이 사라졌습니다. 두 결과를 모두 남기고 인용 규칙을 바꿨습니다.
- +0.1pp 관계 수 +17%가 만든 검색 이득 (p=0.84, 5회 반복 풀링)
- 0.038 → 0.478 동일 설계·동일 코퍼스 독립 2회에서 갈린 p값
-
기법
이미 배포한 커밋을 측정한 뒤 되돌리다
측정 없이 들어간 커밋 하나를 뒤늦게 측정했습니다. 세 변경 중 둘이 지거나 이득이 없었고 전부 되돌렸습니다. 대신 그 실험이 드러낸 다른 결함은 실측 영향 범위가 9건이라 고치지 않고 기록으로 남겼습니다.
- 0 / 3 새 구현이 오라클과 일치한 횟수 — 사전에 정한 규칙대로 되돌림
- 0 / 60 관대한 파서가 실제로 복구한 호출 — 겨냥한 실패는 고칠 수 없는 것이었음
-
기법
기본 모델 교체가 문서의 언어를 바꿨다 — 프롬프트로 못 고친 결함을 코드로 옮기기
문서가 이상한 언어로 나온다는 사용자 리포트의 원인을 기본 모델 교체까지 추적하고 셀 여섯 개로 재현했습니다. 프롬프트 문구 다섯 가지가 전부 한쪽을 고치고 다른 쪽을 깨뜨려, 모델이 못 하는 판정을 코드로 옮겼습니다.
- 20/20 vs 8/20 모델 교체 전후 문서 언어 유지 (Fisher p=4.5e-5)
- 0 / 5 프롬프트 문구 5안이 전부 다른 셀을 깨뜨림 · 코드로 옮긴 뒤 160/160 통과
-
벤치마크
MuSiQue 멀티홉 QA — 지식그래프는 개선이 아니라 전제 조건이다
그래프를 사용한 조건과 키워드 검색만 사용한 조건을 같은 질문 집합에서 대조했습니다. 홉 수가 늘수록 격차가 벌어지고, 4홉에서는 대조군의 정답률이 0%가 됩니다.
- 63.0% vs 23.0% 근거 문단 전부 회수 (ALL@10) · 그래프 사용 vs 키워드 전용
- 0.0% 4홉 질문 17개 중 그래프 없이 성공한 것은 하나도 없음
-
벤치마크
SWE-bench Verified 500개 태스크 전수 측정과, 그 숫자로 주장할 수 없는 것
공식 하니스로 500개 태스크를 전부 돌린 결과입니다. 같은 실행으로는 스캐폴드의 기여분을 분리할 수 없어서, 그 분리는 통제 실험 두 건으로 따로 측정했습니다.
- 78.80% 394 / 500 · 공식 하니스 · 재시도 없음
- 54% → 76% 모델과 태스크 50개를 고정하고 선택 절차만 바꾼 결과