Aria Han

진행 중

llm-bench

기존 리더보드가 실제 업무 성능을 보여주지 못해 실무 기반의 벤치마크 테스트를 직접 구축했습니다.

해결한 문제

공개 리더보드는 실제 업무 환경에서 모델이 요구 성능을 유지할 수 있는지에 대한 핵심 질문에 답하지 못합니다.

구축 내용

데이터 추출, 코드 작성, 버그 수정, 이메일 작성, 프롬프트 인젝션 방어 등 실제 워크플로우 과제를 구성하고 프로그래밍 방식의 검증기로 엄격히 채점합니다. Ollama, Apple Intelligence, Claude CLI, Bedrock, OpenAI 호환 엔드포인트 전반을 지원합니다.

검증 결과

21개 테스트 세트, 프로그래밍 방식 검증기 구축, Opus 4.8 vs 4.7 vs Sonnet vs Haiku 비교 결과 공개. 148 커밋.

학습한 점

평가 척도가 객관적이어야 실질적인 벤치마크가 성립합니다. 코드 기반 검증기는 LLM-as-judge 방식의 모호함을 배제하고 엄격한 신뢰성을 보장합니다.

클라이언트 평가 시스템 설계 및 모니터링 구축에 직결되는 기술 역량을 입증합니다.

기술 스택

Python · Ollama · Bedrock · Claude CLI

status
진행 중 · 실무 워크플로우 벤치마크
stack
Python · Ollama · Bedrock · Claude CLI
scope
표준 · 고난도 · 에이전틱 · 적대적 공격 · 비정형
license
MIT

관련 링크

평가 기준이 명확하고 반증 가능해야 진정한 벤치마크입니다.

연계 프로젝트