- 약 1,030개 에이전트 작업에서 Kimi K3와 Fable 5를 비교한 결과, 작업별 라우팅은 93% 정확도로 개별 모델보다 높은 품질을 달성함
- SWE·터미널·알고리듬·다중 언어·법률 작업에서 전체 성능은 비슷했지만, 두 모델이 강점을 보이는 작업 영역은 서로 달랐음
- 오라클 라우팅은 작업의 72~96%를 K3에 배정했으며, K3는 5개 작업군 모두에서 Fable보다 비용 효율적이었음
- 긴 에이전트 루프에서 K3는 Fable 단독 사용보다 최대 약 50배 높은 비용 효율성을 보였지만, 실행 단계가 많아 처리 시간이 길어질 수 있음
- 저렴한 오픈 모델을 기본으로 삼고 고난도 작업을 다른 모델로 보내는 워크로드 맞춤형 라우터가 품질과 비용을 함께 개선할 수 있음
실제 에이전트 작업으로 측정
- Kimi K3와 Fable 5를 동일한 하네스에서 실행해 실제 에이전트 루프 형태의 약 1,030개 작업을 수행함
- SWE: 실제 저장소의 버그 수정과 유사한 작업 460개
- 터미널: 보안·암호학·리버스 엔지니어링·시스템 관리 등 장기 에이전트 작업 89개
- 알고리듬: LeetCode·AtCoder 유형 문제 100개
- 다중 언어: 6개 언어 구현 작업 225개
- 법률: 변호사가 채점하는 법률 에이전트 작업 120개
- 여러 작업 유형을 대상으로 한 벤치마크 결과를 평균해 두 모델을 비교함
오라클 라우팅의 의미와 한계
- 오라클 라우팅은 각 작업을 모든 모델에서 실행한 뒤, 정답을 낸 선택지 가운데 가장 저렴한 모델을 고르는 이론적 측정 방식임
- 실제 라우터는 작업을 여러 모델에서 미리 실행할 수 없으므로, 비용과 품질의 균형이 가장 좋은 모델을 사전에 예측해야 함
- 이 방식에서는 전체 작업의 72~96%에 K3가 선택됨
- 일상적인 작업과 최상위 모델이 필요한 긴 꼬리 작업을 구분하는 라우터가 가능할 수 있음
- 이를 확정하려면 한 자릿수 규모가 아닌 10배 수준의 추가 라우팅 데이터와 실제 환경에서의 성능 검증이 필요함
종합 성능은 비슷하지만 강점은 다름
- 대표 SWE 결과는 K3 92.4%, Fable 92.6% 로 거의 같았음
- 5개 작업 유형 전반에서도 두 모델의 차이는 대체로 몇 퍼센트포인트 이내였으며, Fable은 다중 언어 코딩 범위에서 조금 앞섰음
- 비슷한 종합 점수와 달리 세부 작업에서는 각 모델이 뚜렷하게 우세한 영역을 보임
작업 영역별 차이
- SWE를 문제 영역별로 나누면 K3는 기호 수학과 개발 도구, Fable은 웹과 데이터 시각화 작업에서 우세했음
- 다중 언어 작업에서는 Fable이 Java·Python·C++에서 앞섰고, K3는 JavaScript·Rust에서 대등했음
- 수십 차례 셸을 조작하는 장기 터미널 작업에서는 K3가 강점을 보임
- Fable이 해결하지 못한 7z 해시, FEAL 암호 분석, 유출된 비밀정보, 실제 취약점, 통제 불능 비동기 작업을 해결함
- 정확도와 비용을 함께 비교하면 Fable은 다중 언어, K3는 터미널과 법률에서 앞섰으며 나머지는 대체로 비슷했음
비용 격차를 만드는 구조
- K3의 비용 우위는 토큰 가격·프롬프트 캐싱·작업별 투입량에서 발생함
- SWE 작업 하나당 K3는 약 55턴과 130만 토큰을 사용한 반면, Fable은 약 21턴과 13만 토큰을 사용함
- 긴 터미널 작업에서는 반대로 Fable이 약 64턴과 150만 토큰까지 사용하며 때로는 시간 초과에 도달함
- K3가 SWE에서 10배 많은 토큰을 읽어도 프롬프트 캐시 적중 덕분에 실행 비용은 Fable보다 낮았음
- 실행 단계가 많아지면 실제 처리 시간이 길어질 수 있음
- 2초 안에 답해야 하는 작업에서는 지연 시간이 중요함
- 대규모 백그라운드 에이전트에서는 더 낮은 비용 청구액이 중요해짐
두 모델을 결합한 결과
- 작업마다 더 적합한 모델로 보내면 두 모델의 중간 수준이 아니라 각 단일 모델보다 높은 성능을 얻을 수 있음
- 작업별 오라클 라우팅은 개별 모델 실행보다 항상 높은 성능을 보였고, 전체 정확도는 93% 에 도달함
- 트래픽의 72~96%를 비용 최적화 모델인 K3로 보내면서도 전체 품질은 각 모델보다 높고, 비용은 K3 단독 사용에 가까워짐
- K3는 5개 작업군 모두에서 Fable보다 비용 효율적이었으며, 긴 에이전트 루프에서는 최대 약 50배 높은 비용 효율성을 기록함
단일 모델보다 워크로드별 라우팅
- Kimi K3와 Fable을 함께 라우팅하면 서로 다른 강점을 활용하면서 비용을 낮출 수 있음
- 모델마다 가격과 전문 영역이 다르므로, 최고 품질의 AI는 단일 제공자보다 여러 모델의 조합에서 나올 수 있음
- 비용이 최대 50배 낮고 오라클이 대부분의 트래픽을 배정한 K3 같은 오픈 모델을 기본 선택지로 삼을 수 있음
- 라우터는 실제 워크로드에 맞춰야 하며, 작업과 모델의 적합 관계를 지속해서 학습해야 함