비드래프트, 자체 자가개선 AI로 허깅페이스 공인 법률 시험 1위...7개 부문 석권

법률 데이터 학습 없이 '재귀적 자가개선(RSI)' 기술로 고난도 'LEXam' 벤치마크 석권 기사입력:2026-10-01 14:10:00
사진=비드래프트

사진=비드래프트

이미지 확대보기
[로이슈 이강훈 기자] 인공지능(AI) 딥테크 스타트업 비드래프트(VIDRAFT, 대표 김민식)는 자가 학습형 추론 모델 'Darwin-180B-RSI'가 글로벌 AI 플랫폼 허깅페이스(Hugging Face)의 공인 법률 추론 벤치마크인 'LEXam'과 'LEXam-hard'에서 각각 1위를 기록했다고 1일 밝혔다. 해당 모델은 사전에 법률 도메인 데이터를 별도로 학습하지 않은 상태에서 평가를 거쳤으며, 기존에 확보한 수학, 과학, 종합지식, 시각추론 5개 부문을 포함해 허깅페이스 공인 리더보드 7개 부문에서 1위를 차지하게 됐다.

이로써 비드래프트는 허깅페이스가 공인한 총 47개 벤치마크 리더보드 중 7개 부문 정상에 오르며 전 세계 AI 기업 가운데 가장 많은 1위 타이틀을 확보했다. 이는 지푸AI(4개), 딥시크·샤오미·문샷AI(각 3개) 등 주요 글로벌 빅테크 기업의 기록을 앞선 수치로, 국내 인공지능 개발사 중에서는 최다 실적이다.

이번 성과는 모델의 훈련 메커니즘에서 기인한다. Darwin-180B-RSI는 인간이 작성한 해설 데이터를 주입하는 전통적 방식 대신, 모델이 자율적으로 문제를 풀고 정답 여부를 기계적으로 검증한 뒤 정답 처리된 논리 경로만 선별해 재학습하는 '재귀적 자가개선(RSI, Recursive Self-Improvement)' 프레임워크로 구축됐다. 자가 개선된 모델이 차기 단계의 연산 주체가 되는 반복 구조를 띠며, 기초 학습 단계에서는 정답 판별이 자동화되는 수학 및 과학 문항만을 활용했고 인간이 작성한 중간 풀이 데이터는 배제했다.

이 같은 구조를 통해 법률 비학습 모델임에도 법률 추론 평가에서 최고점을 획득했다. LEXam은 스위스 취리히연방공대(ETH Zurich), 취리히대, 독일 막스플랑크연구소 공동 연구진이 구축한 공인 법률 추론 벤치마크로, 법률 전문 인력의 정답 검증을 거쳤다. 스위스 고등교육기관 법학과의 실제 기말시험 340회분 문항을 바탕으로 구성돼 단순 법조문 암기가 아닌 사실관계 기반의 법률 적용 및 결론 도출 역량을 측정한다. 평가는 객관식(LEXam) 1,655문항과 서술형(LEXam-hard) 518문항으로 이뤄지며, 스위스 법제가 한국과 동일한 대륙법 체계에 속해 있어 국내 법률·행정 실무 분야의 AI 도입 타당성을 가늠하는 지표로 평가받는다.

해당 테스트는 글로벌 최고 수준의 거대언어모델(LLM)에도 난도가 높은 과제로 꼽힌다. 4지선다형 객관식 구조임에도 6,850억 개 파라미터(매개변수)를 갖춘 딥시크-R1을 포함한 주요 최상위 모델들의 평균 점수는 50점 내외에 머물렀다. 무작위 선택 시 기대 점수가 25점인 점을 감안하면 정답률이 절반 수준에 그친 셈이다. 특히 서술형인 LEXam-hard는 주요 공개 모델들이 극히 낮은 점수를 보인 고난도 문항만 추출해 구성됐으며, 기존 최고 점수 역시 40점대에 머물렀다.

비드래프트는 이번 시험 결과를 통해 자가개선 기법이 개별 도메인 '지식'의 습득을 넘어 보편적인 '추론 프로세스'를 정립하는 데 기여한다는 점을 확인했다고 설명했다. 수학·과학 영역에서 오답을 배제하며 축적한 다단계 논리 전개 능력이 비학습 분야인 법률 체계로 전이됐다는 분석이다. 실제로 해당 모델은 베이스 모델과 동등한 정밀도를 유지하면서 추론 토큰 길이를 11% 단축해 불필요한 연산 경로를 최적화했다.

세부 평가 결과에서도 격차를 보였다. 객관식 LEXam에서 68.94점을 기록해 기존 선두였던 딥시크의 'DeepSeek-R1'(52.41점)을 16점 이상 상회했으며, 알리바바의 'Qwen3-235B-Thinking'(48.19점), 오픈AI의 'gpt-oss-120b'(47.71점)를 앞섰다. 1,800억 파라미터 규모의 모델이 6,850억 파라미터급 초대형 모델을 추월한 셈이다. 공식 채점 모델을 통해 평가된 서술형 LEXam-hard에서도 45.72점을 기록해 싱킹머신즈의 'Inkling'(40.82점)과 딥시크의 'DeepSeek-V4-Pro'(38.93점)를 넘어섰다.

개발진이 독립적으로 집계한 주요 폐쇄형 모델의 평가 수치와 비교해도 우위를 나타냈다. 해당 벤치마크 개발진이 측정한 오픈AI 'GPT-5'(62.65점), 앤트로픽 'Claude-4.5-Sonnet'(58.01점), 구글 'Gemini-2.5-Pro'(55.72점)의 수치를 상회하는 결과다(문항당 4회 반복 풀이 다수결 기준 68.94점). 다수결 보정 없는 단일 추론(1-pass) 방식에서도 60.54점을 기록해 Claude-4.5-Sonnet 및 Gemini-2.5-Pro의 공식 측정치를 앞섰다.

최근 자가개선 알고리즘은 인공지능 연구의 핵심 영역으로 부상하고 있다. 구글이 기본 가중치를 유지한 채 프롬프트, 외부 도구, 워크플로를 자율 조정하는 시스템 수준 자가개선(RRSI)을 선보인 반면, 비드래프트는 모델 내부 파라미터 가중치를 직접 갱신하는 '모델 수준' 자가개선 아키텍처를 취했다. 이는 개선 결과가 단일 가중치 파일에 영구 반영되므로 사용자가 부가 시스템 없이 모델 파일만으로 성능을 온전히 활용할 수 있는 구조적 특성을 지니며, 회사 측은 양 방식이 상호 보완적 관계를 형성한다고 부연했다.

회사는 평가의 신뢰성을 담보하기 위해 풀이 횟수, 앙상블 다수결 여부, 추론 토큰 예산 등 세부 벤치마크 파라미터를 전면 공개했다. 객관식 점수는 4회 풀이 기반 다수결 방식이며, 단일 연산 조건에서도 60.54점으로 기존 리더보드 최고점을 상회한다. 모델의 체크포인트와 검증 환경은 허깅페이스 저장소에 오픈소스로 공개돼 외부 검증이 가능하다.

사진=비드래프트

사진=비드래프트

이미지 확대보기
현재 Darwin-180B-RSI는 허깅페이스 공인 주요 벤치마크 리더보드 전반에서 최상위 점수를 기록하고 있다. 수학 영역인 'AIME 2026'과 'HMMT 2026'에서 각각 100점 만점을 획득해 완전한 문제 해결 능력을 입증했으며, 고난도 과학 추론 벤치마크인 'GPQA Diamond'에서는 94.44점을 기록해 최고 수준에 도달했다. 아울러 종합 지식 평가 지표인 'MMLU-Pro'에서 88.12점, 멀티모달 시각 추론을 평가하는 'MMMU-Pro'에서는 79.48점을 달성했다. 여기에 법률 분야의 사실관계 적용 능력을 검증하는 'LEXam'과 'LEXam-hard'에서도 각각 68.94점과 45.72점을 기록해 선두 자리를 굳혔다.

본 모델의 기반 프레임워크는 비드래프트의 자체 진화 알고리즘인 'Darwin'이다. Darwin 기술은 생물학적 진화 원리를 신경망에 투영해 부모 모델의 레이어(Layer)와 전문가(Expert) 모듈별 강약점을 정밀 진단한 뒤, 다수 모델의 최적 파라미터 구간을 선별 이식해 융합하는 방식이다. 수백억 원 규모의 대규모 사전학습 비용을 투입하지 않고도 기존 오픈소스 모델의 장점을 재조합해 고성능 파생 모델을 도출할 수 있다. 반복적 무작위 탐색을 수행하던 기존 진화 기법과 달리 진단 기반 압축 공정을 적용해 연산 비용을 통제하고 최대 3,970억 파라미터급 모델까지 확장성을 검증했다. Darwin 제품군은 현재 허깅페이스 내 50여 종의 공식 모델과 400여 종의 파생 모델 생태계를 구축했으며, 원천 기술 논문은 아카이브(arXiv 2605.14386)를 통해 공개됐다.

Darwin-180B-RSI는 Darwin 알고리즘으로 구조적 최적화를 거친 모델에 재귀적 자가개선(RSI) 메커니즘을 결합해 완성됐다. 전체 파라미터 중 약 0.02%만을 선별적으로 미세 조정했으며 지식 정보를 관장하는 512개 전문가 모듈, 라우팅 네트워크, 비전 인코더는 기존 구조를 보존했다. 베이스 모델의 기본 구조 위에 자율적 추론 체계를 얹은 이중 아키텍처 형태다.

이와 함께 추론 출력 전 단계에서 내부 활성화 텐서를 분석해 정답 확률을 도출하는 'ZTC(Zero-Token Confidence)' 기술이 적용됐다. ZTC는 자가개선 학습 루프 내에서 모델이 미인지 상태인 영역을 스스로 판별하는 신호 전달체로 기능한다.

비드래프트는 기업 맞춤형 인공지능 솔루션을 공급하는 'AI 파운드리' 사업 모델을 전개하고 있다. K-AI 리더보드 종합 1위 및 구글 '더 패스트 젬마 챌린지(The Fast Gemma Challenge)' 1위를 기록한 바 있으며, 회사가 배포한 인공지능 모델의 허깅페이스 공식 누적 다운로드 수는 250만 회를 상회하고 있다.

김민식 대표는 "법률을 배운 적 없는 AI가 법률 시험 1위를 한 것은, 스스로 문제를 풀고 검증하며 배운 AI가 암기가 아닌 추론하는 법 자체를 익힌다는 증거"라며 "법무·공공·금융처럼 정확한 판단이 필요한 분야에서 스스로 성장하는 신뢰할 수 있는 AI를 만들겠다"고 말했다.

모델 아키텍처 및 상세 평가 데이터는 허깅페이스 공식 리포지토리를 통해 확인할 수 있다.

이강훈 로이슈(lawissue) 기자 lkh@lawissue.co.kr
ad

주식시황 〉

항목 현재가 전일대비
코스피 6,971.35 ▲133.31
코스닥 894.29 ▲38.38
코스피200 1,104.48 ▲22.66

가상화폐 시세 〉

암호화폐 현재가 기준대비
비트코인 113,950,000 ▼344,000
비트코인캐시 418,200 ▼3,400
이더리움 3,668,000 ▼18,000
이더리움클래식 12,020 ▼140
리플 2,019 ▼14
퀀텀 1,339 ▼9
암호화폐 현재가 기준대비
비트코인 113,937,000 ▼411,000
이더리움 3,669,000 ▼17,000
이더리움클래식 12,030 ▼140
메탈 432 ▼3
리스크 369 ▼3
리플 2,020 ▼12
에이다 335 ▼5
스팀 86 ▼1
암호화폐 현재가 기준대비
비트코인 113,910,000 ▼440,000
비트코인캐시 417,800 ▼3,800
이더리움 3,666,000 ▼21,000
이더리움클래식 12,010 ▼140
리플 2,018 ▼15
퀀텀 1,307 0
이오타 74 ▼1
ad