연구 프로젝트, 부정적 결과(Negative Results) 보존
latent-diagnostics
단순히 출력 정답률만 측정하는 것을 넘어, 모델이 내부적으로 유의미한 연산을 수행했는지 검증하고자 했습니다.
해결한 문제
최종 답변 채점 방식은 모델의 정답 여부만 알려줄 뿐, 내부 잠재 공간에서 실제로 계산이 일어났는지 여부는 밝히지 못합니다.
구축 내용
답변 채점을 넘어 어트리뷰션 그래프의 기하학적 구조를 분석합니다. 텍스트 길이를 통제한 상태에서도 과제 도메인별 실제 연산 서명이 확인되었습니다. 반면 환각 감지 가설은 동일한 엄격한 검증을 통과하지 못했으며, 연구 저장소는 이러한 부정적 결과 또한 가감 없이 문서화했습니다.
검증 결과
길이 통제 후 문법적 영향 계수 d=1.08 도출. 108 커밋. 검증에 실패한 가설을 입증된 가설과 함께 투명하게 기록.
학습한 점
실패한 연구 결과 역시 중요한 지적 자산입니다. 환각 감지 가설이 길이 통제를 견디지 못했다는 사실을 명확히 기록하여 연구적 신뢰도를 확보했습니다.
통계적 통제와 데이터 정직성을 기반으로 엄밀한 가설 검증을 수행하는 연구 방법론적 역량을 증명합니다.
기술 스택
Python · SAEs · Attribution graphs
- status
- 연구 · 실패 결과 보존
- stack
- Python · SAEs · Attribution graphs
- finding
- 길이 통제 후 문법 영향 계수 d=1.08
- license
- MIT
관련 링크
단순히 정답을 내는 것과 실제 유의미한 연산을 거치는 것은 근본적으로 다릅니다.