Accept: text/markdown
메모리 시스템, 벤치마크, 평가 도구, 포터블 워크플로우, 생성형 아트 실험 등 축적된 결과물을 공개합니다.
웹사이트의 시각적 완성도와 별개로, 검색 엔진 및 AI 시스템이 요구하는 데이터 레이어의 결함을 진단합니다.
Agents that keep working without you need a place where you can see and answer them.
A screen should be inspectable in every meaningful state before the whole app can run.
매번 컨텍스트가 초기화되는 문제를 방지하기 위해 Claude Code에 영구 메모리, 검증 훅, 실행 규칙을 결합했습니다.
기존 리더보드가 실제 업무 성능을 보여주지 못해 실무 기반의 벤치마크 테스트를 직접 구축했습니다.
단편적인 프롬프트 모음의 한계를 넘어, 반복되는 워크플로우를 이식 가능한 에이전트 스킬로 체계화했습니다.
단순 순위 비교를 넘어, 실제 업무 관계 속에서 모델이 축적한 성능 데이터를 파악하고자 했습니다.
지속적인 검증 게이트가 없는 메모리 저장은 단순한 노이즈로 전락합니다.
모델이 본문을 작성하더라도, 예약 발송 메일의 구조와 레이아웃은 매일 결정론적으로 일관되어야 합니다.
사람의 개입 없이 매일 작동하는 완전 자율 창작 파이프라인의 장기적인 결과물을 실험했습니다.
단순히 출력 정답률만 측정하는 것을 넘어, 모델이 내부적으로 유의미한 연산을 수행했는지 검증하고자 했습니다.