채용 공고에 '이벨(Evals) 경험'이 스펙으로 들어가기 시작했다
지난주 이런 채용 공고를 봤습니다. PM 포지션인데 자격 요건에 "이벨(evals) 작성 경험"이 들어가 있더군요. 처음엔 낯설었습니다. 이벨은 원래 모델을 만드는 엔지니어들이나 쓰는 말이었으니까요.
그런데 이유를 듣고 나니 이해가 됐습니다. 요즘 Claude, GPT, Grok 같은 모델들이 몇 달 간격으로 쏟아지는데, 하나같이 이전 버전보다 좋다고 홍보합니다. 실제로 다 꽤 좋습니다. 그래서 오히려 "어떤 모델이 제일 좋아요?"라는 질문이 의미가 없어졌습니다. 좋고 나쁨의 차이가 아니라, 내 일에 맞는지 아닌지의 차이로 바뀐 겁니다.
저도 요즘 자동화 루틴을 여러 개 돌리면서 매번 이 판단을 합니다. 어떤 작업은 Claude가 낫고, 어떤 작업은 다른 모델이 더 빠르고 쌉니다. 문제는 이 판단 기준이 머릿속에만 있고 기록되지 않는다는 겁니다. 그래서 새 모델이 나올 때마다 처음부터 다시 테스트합니다.
이번 주 읽은 글에서 좋은 방법을 하나 배웠습니다. AI가 틀렸거나 애매했던 작업 10개를 모아서, 여러 모델에 돌려보고, "이게 왜 별로였는지"를 말로 설명한 다음 그 설명을 예/아니오로 답할 수 있는 체크리스트로 바꾸는 겁니다. 이렇게 쌓인 체크리스트가 나만의 벤치마크가 됩니다. 새 모델이 나올 때마다 감으로 판단하는 대신 그 체크리스트로 채점하면 됩니다.
"어떤 모델을 쓰느냐"는 이제 스킬이 아닙니다. "내 일에 맞는 모델을 어떻게 판별하느냐"가 스킬입니다. 여러분은 새 모델이 나올 때마다 어떤 기준으로 판단하시나요?
전체 기록 → Home