벤치마크 점수만으로는 알 수 없는 것
공개 벤치마크는 표준 문제 세트를 정답 채점이나 평가자 점수로 매긴 결과입니다. 그래서 그 모델이 우리 서비스의 기능 하나하나에서 어떤 성과를 내는지는 이 점수로 알 수 없습니다.
리뷰 요약에서 뛰어난 모델이 상담 답변에서는 평범할 수 있습니다. 그래서 기능마다, 실제 트래픽으로 따로 확인해야 합니다.
LLM A/B 테스트는 이렇게 진행합니다
먼저 같은 AI 기능을 쓰는 유저를 옵션별로 나눕니다. 어떤 옵션을 받을지는 기기 기준으로 정해집니다. 호출에 기기 ID를 함께 보내면 같은 유저는 비율을 바꾸기 전까지 계속 같은 옵션을 받습니다.
다음으로 구매, 요약 복사처럼 무엇을 성공으로 볼지 성과 지표를 정합니다. 앱토는 옵션별 성과를 호출당 비용, 지연시간, 에러율과 함께 보여 줘서, 성과가 비슷하면 더 저렴한 쪽을 기능별로 고를 수 있습니다.
새 모델은 작은 비율부터
새 옵션은 비율 0으로 저장되고, 비율을 직접 올리기 전까지 유저에게 적용되지 않습니다. 처음에는 10%만 주고 이상이 없는지 확인한 뒤, 차이가 확실해지면 비율을 늘리기를 권합니다.
문제가 생기면 새 옵션을 0으로, 기존 옵션을 100으로 되돌리면 몇 초 만에 끝납니다. 한 기능에 옵션은 다섯 개까지 둘 수 있습니다.
모델뿐 아니라 프롬프트도 비교합니다
고친 프롬프트가 정말 나아졌는지도 유저의 행동으로 판정합니다. 실제 유저에게 보내기 전에는 같은 입력으로 새 모델과 프롬프트 후보를 견주어 볼 수도 있습니다.