- Echo는 GLM-5.2, Kimi K2.7 등 여러 오픈 가중치 모델을 요청별로 조합해, 단일 모델에 모든 작업을 맡기는 방식의 한계를 보완함
- 요청마다 연산량과 참여 모델을 정하고 결과 결합 방식까지 조정해, 간단한 프롬프트에는 적은 추론 자원을 사용함
- 첫 평가 구성에서 풀의 최고 개별 모델을 일관되게 앞섰으며, Fable과 비슷한 종합 결과를 약 3분의 1 추론 비용으로 달성함
- 전반적으로 약한 모델도 특정 문제나 조합에서는 유용할 만큼 능력이 상호 보완적이지만, 할당과 결합을 잘못 결정하는 사례도 남아 있음
- 채팅 인터페이스와 OpenAI 호환 API를 공개했으며, 품질 측정이 더 어려운 코딩·에이전트 작업에서도 같은 접근법이 유효한지 시험 중임
모델 선택과 결과 결합
- 초기 실험에서는 GLM-5.2, Kimi K2.7 등을 동일한 평가에 투입하고, 문제마다 유용한 모델과 적절한 출력 결합법을 사전에 안다고 가정해 결과를 측정함
- 이 가상 시스템은 풀에 포함된 어떤 개별 모델보다도 훨씬 높은 성능을 냄
- 결과를 확인한 뒤에야 좋은 결정을 식별할 수 있어 실제 배포에는 사용할 수 없으며, Echo는 사전 정보 없이도 그 이점의 일부를 회복하려는 시도임
- 요청의 특성에 따라 필요한 연산량과 참여 모델, 결과 결합 방식을 선택함
- 간단한 프롬프트에는 비교적 적은 추론을 할당함
- 다른 문제에서는 여러 모델이 서로 다른 부분을 처리하도록 구성함
- 모델들의 능력은 상호 보완적이어서, 전체 성능이 명확히 낮은 모델도 특정 문제나 조합에서는 매우 유용할 수 있음
평가 결과와 공개 테스트
- 첫 평가 구성에서 최고 개별 모델보다 일관되게 높은 성능을 기록했으며, 비교 대상인 Fable과 대략 같은 종합 결과를 약 3분의 1 비용으로 달성함
- 일부 요청에서는 연산 할당이나 모델 결합을 잘못 결정하며, 현재 이러한 실패 사례를 분석하고 있음
- 코딩 및 에이전트 작업은 각 결정의 품질을 측정하기가 훨씬 어려워, 동일한 접근법이 유지되는지 별도로 시험 중임
- 외부 테스트를 위해 Echo 채팅 인터페이스와 OpenAI 호환 API를 제공함
- 작동 방식 소개 영상과 평가 방법론·개별 모델 결과·비용·현재 한계를 공개하고, 비정상적인 실패나 직관적이지 않은 자원 할당 사례에 대한 피드백을 요청함