- 전자상거래 카탈로그 검수용 9B 오픈소스 모델을 약 500달러로 강화학습 미세조정한 결과, 같은 도구·이미지·채점기를 사용한 모든 프런티어 모델 구성보다 높은 점수를 기록함
- 17만7,767개 검수 에피소드로 만든 디지털 트윈에서 상품 분류, 브랜드 확인, 속성 추출, 정책 판정을 반복해 기업 고유의 분류 체계와 판단 기준을 모델 가중치에 학습시킴
- GRPO 학습 모델은 달성 가능한 최대 점수의 87.3% 를 기록해 최상위 프런티어 구성의 76.9%보다 상대적으로 13.5% 높았고, 미학습 기반 모델의 64.2%보다 36% 향상됨
- 비용은 상품 1,000개당 약 0.50달러로 가장 저렴한 프런티어 구성보다 40배, 가장 비싼 구성보다 약 340배 저렴하며, 하루 4,000만 건 규모에서는 연간 약 700만 달러와 5억 달러의 차이가 남
- 결과를 규칙·테스트·평가표로 검증할 수 있는 대량 반복 업무에 적합하며, 변하는 사실은 검색 도구에 두고 기업 고유의 판단 방식은 모델에 학습시키는 구조가 필요함
AI 투자 성과를 가르는 운영 방식
- ChatGPT 출시 이후 AI 활용은 문서 요약과 이메일 초안 같은 저위험 업무에서 소프트웨어 개발, 콘텐츠 생성, 내부 지식·데이터·도구를 연결하는 회사 두뇌(company brain) 구상으로 확대됨
- Ramp 고객 데이터에서 AI 지출 상위 25% 기업은 2022년 11월부터 2025년 12월까지 매출이 2배 이상 늘었지만, AI 지출이 없는 기업은 같은 기간 약 15% 성장함
- 성과를 내는 조직에는 다음 운영 방식이 반복됨
- 업무 흐름 재설계: 기존 절차에 모델만 추가하지 않고 승인, 검토, 인계와 인간 개입 지점을 다시 설계해야 함
- McKinsey의 2025년 생성형 AI 이용 조직 조사에서 업무 흐름 재설계는 EBIT 영향과 가장 높은 상관관계를 보였지만, 실제로 하나라도 재설계한 조직은 21%에 그침
- 실험 장려: 모델과 도구, 모범 사례가 빠르게 바뀌므로 성공적인 출시뿐 아니라 실험과 실패 공유에도 보상이 필요함
- 맞춤형 업무 맥락: 데이터 접근, 요청별 접근 제어, 관련 근거 검색, 길어질수록 활용이 불균등해지는 컨텍스트 창 관리가 별도 엔지니어링 과제가 됨
- 사용량과 효과 측정: 자체 데이터에 대한 채점 평가가 없으면 성능, 의사결정 비용, 효율 영향을 입증하기 어려우며 자기 보고식 시간 절감 수치도 부정확할 수 있음
- 업무 흐름 재설계: 기존 절차에 모델만 추가하지 않고 승인, 검토, 인계와 인간 개입 지점을 다시 설계해야 함
‘지능 소유’를 위한 배포 방식
- 반복적으로 나타나는 구성은 오픈소스 모델, 기업 고유의 작업 데이터, 채점 가능한 업무 흐름을 이용한 강화학습임
- 프런티어 모델은 자동화 가능성을 확인하고 초기 기준선을 세우는 데 활용함
- 호출 과정에서 입력, 결정, 수정 기록이 쌓이며 이후 전문 모델의 학습 데이터가 됨
- 프로토타입을 벗어나 대량 운영 단계에 들어가면 호출당 비용과 성능이 우선순위가 됨
- 프런티어 모델과 전문 모델은 서로 완전히 대체하는 관계가 아님
- ChatGPT나 Claude 같은 범용 모델이 내부 지식이 필요한 부분을 전문 모델에 맡길 수 있음
- 전문 모델도 높은 범용 능력이 필요한 작업에서는 프런티어 모델을 호출할 수 있음
- 모델은 기업의 도구와 데이터로 작업하고, 평가표(rubric) 가 결과를 채점하며, 보상 신호가 모델을 갱신함
- 수만 개 작업을 반복하면 업무 판단이 가중치에 자리 잡음
- 가격, 재고, 정책 문서처럼 변하는 사실은 도구에 유지함
전문 모델의 실제 배포 사례
- Bridgewater Associates는 기사, 공시, 이메일이 투자 논지와 관련 있는지, 상투적 문구가 어디서 시작되는지를 판단하도록 전문 투자자의 라벨로 오픈소스 모델을 학습함
- 프롬프트만으로는 내부 판단 기준을 안정적으로 반영하지 못했음
- 학습 모델은 최상위 프런티어 모델보다 오류가 약 30% 적고, 추론 비용도 낮았음
- Harvey는 거래 실사와 법률 메모 작성처럼 여러 단계에 걸쳐 오류가 누적되는 작업에 오픈 가중치 모델과 강화학습을 적용함
- 자체 평가표에서 법률 에이전트가 GPT-5.5와 Claude Opus 4.8을 능가함
- Intercom Fin Apex는 매주 약 200만 건의 고객 문제를 처리하는 규모에서 호출당 비용과 해결률을 개선하기 위해 수십억 건의 고객 서비스 상호작용으로 후속 학습됨
- 최상위 프런티어 모델보다 더 많은 문제를 해결하면서 운영비도 낮다고 Intercom이 밝힘
- 공통 배포 과정은 프롬프트와 컨텍스트를 최적화한 프런티어 모델로 기준선을 만든 뒤, 실행 기록과 학습 내용을 기업이 소유하는 작은 모델로 이전하는 방식임
카탈로그 무결성과 비용 문제
- 전자상거래 카탈로그는 모든 상품을 올바른 분류 체계에 배치하고, 검색·필터·추천·후속 운영에 쓰이는 속성을 이미지와 설명에서 정확히 추출해야 함
- 잘못된 판단은 상품 검색성과 추천 품질을 떨어뜨리고 정책 위반을 놓치게 함
- 위조품을 놓치면 고객과 브랜드가 사기에 노출됨
- 정상 상품을 과도하게 표시하면 검토 대기열과 판매자 불편이 늘어남
- 업무 규모도 큼
- eBay에는 약 25억 개의 활성 상품이 있음
- Shopify 카탈로그에는 하루 1,000만 건 이상의 상품 업데이트가 들어옴
- Walmart는 AI 지원 카탈로그 작업을 사람만으로 수행하면 약 100배의 인력이 필요했을 것으로 추산함
- 소비자 71%는 실제 상품이 등록 정보와 달라 반품한 경험이 있다고 답함
- 중간 규모 마켓플레이스가 하루 약 1,000만 건의 상품 생성·수정을 처리할 경우, 프런티어 모델 기반 검수는 연간 약 5억 달러, 미세조정 전문 모델은 약 1,000만 달러로 추산됨
- Shopify는 상업용 API로 경제적으로 감당하기 어렵다는 이유로 미세조정한 오픈 모델을 이용해 하루 약 4,000만 회의 상품 분류 추론을 수행함
카탈로그 검수 에이전트의 작업
- 에이전트는 상품을 검토하면서 분류 체계를 검색하고 브랜드를 확인하며, 해당 분류의 속성 스키마를 가져온 뒤 구조화된 결정을 확정함
- 근거가 부족하거나 위험이 높으면 인간 검토로 넘김
- 작업용 장갑 사례는 다음 순서로 처리됨
search_taxonomy로Safety Work Gloves분류를 찾음lookup_brand로 AmazonBasics가 등록됐지만 보호 대상은 아님을 확인함get_attribute_schema로 브랜드, 색상, 소재, 크기 속성을 조회함- 분류·속성과 함께
allowed판정을 확정함
- 실제 위반을 놓치는 비용을 오탐보다 7배 높게 설정해 두 오류를 비대칭적으로 학습함
학습용 디지털 트윈
- Amazon Berkeley Objects의 실제 상품 이미지와 등록 정보를 이용해 17만7,767개 검수 에피소드를 구축함
- 에피소드마다 이미지, 제목, 설명, 주장된 브랜드, 지역을 포함함
- 통제된 정책 위반, 불일치 이미지, 충돌하는 브랜드 주장과 함께 정당한 주장을 어려운 음성 사례로 삽입함
- 모든 에피소드에는 채점 가능한 정답이 존재함
- 모델이 사용하는 환경은 실제 분석가의 작업을 재현함
- 약 1만3,000개 분류를 검색함
- 브랜드의 등록·보호 여부를 확인함
- 선택한 분류에 필요한 속성을 가져옴
- 최종 분류, 속성, 정책 결정을 확정함
- 채점기는 정답에 보상하고 위반 누락, 근거 없는 속성, 잘못된 분류, 불필요한 도구 호출에 벌점을 부과함
- 실제 업무의 목록, 도구, 판정 비용을 재현한 환경에서 실패와 재시도를 반복할 수 있어야 강화학습이 가능함
프런티어 모델 기준선
- GPT-5.5, GPT-5.6-sol, Gemini 3.1 Pro, Claude Opus 4.8, Claude Fable 5를 계층화한 검증 에피소드 200개에서 비교함
- 모든 모델에 같은 도구, 이미지, 채점기, 턴 예산을 적용함
- 기본 프롬프트와 2,800자 분량의 추출 규칙, 조회 절차, 예시를 담은 최적화 프롬프트를 각각 시험함
- 최상위 프런티어 구성은 달성 가능한 점수의 76.9%, GRPO 학습 9B 모델은 87.3%를 기록함
- 프런티어 모델은 매 에피소드마다 해당 상점의 분류 체계, 재고 관례, 지원되는 속성 값, 예외 처리 방식을 프롬프트에서 다시 구성해야 함
- 최적화 지침으로 일부 지식을 압축할 수 있지만 점수를 좌우하는 모든 예외를 열거할 수는 없었음
- 최적화된 프런티어 구성들은 서로 0.1%포인트 이내로 수렴함
- 제로샷 추출 성능이 가장 높았던 Gemini는 최적화 지침 적용 후 오히려 성능이 낮아짐
- 추가 지침은 모델에 따라 입력 토큰 비용을 호출마다 28~55% 높임
- 프롬프트에 담은 작업 지식은 호출할 때마다 비용이 들지만, 학습된 지식은 가중치에 유지됨
500달러 규모의 GRPO 학습
- 학습에는 RTX PRO 6000 GPU 2대를 임대해 하나는 롤아웃 생성, 다른 하나는 경사 갱신에 사용함
- 인프라는 오픈소스 prime-rl로 구성함
- 전체 학습은 최적화 1,000단계, 약 3.5일, GPU 비용 약 500달러가 들었음
- 약 250단계와 하루 정도의 학습만으로 프런티어 모델 구간을 넘어섬
- 나머지 단계는 최대 성능을 끌어내는 데 사용함
- 최종 엄격 벤치마크 점수는 0.626으로 달성 가능한 상한의 87.3%이며, 최상위 프런티어 구성보다 약 10%포인트 높음
- W&B 학습 모니터에서는 약 0.50에서 1,000단계의 0.671까지 상승함
- 모니터는 에피소드당 표본 롤아웃 2개를 사용해 엄격한 벤치마크 하네스보다 점수가 조금 높음
- 미학습 9B 기반 모델은 최대 점수의 64.2%였고, 미세조정 후 87.3%로 올라 상대적으로 약 36% 향상됨
- 전문 모델은 분류 체계, 도구, 정책과 보상의 관계를 학습해 특정 환경의 행동에 역량을 집중하며, 그 대신 범용 능력을 희생함
- 더 강한 오픈소스 기반 모델이 나오면 같은 학습법을 이전할 수 있고, 운영 중 기록된 결정도 지도 미세조정 데이터로 증류해 후속 재학습에 활용할 수 있음
비용과 품질 비교
- 전문 모델의 추론 비용은 상품 1,000개당 약 0.50달러이며, 미세조정으로 같은 비용에서 기반 9B 모델보다 약 23%포인트 높은 점수를 얻음
- 비교 대상의 비용 차이는 다음과 같음
- 가장 저렴한 프런티어 구성인 Gemini는 1,000개당 19달러로 전문 모델보다 40배 비쌈
- 가장 비싼 GPT-5.5-pro는 1,000개당 172달러로 약 340배 비쌈
- 가장 높은 프런티어 점수를 낸 구성은 1,000개당 34달러로 전문 모델보다 68배 비쌈
- 2,800자 지침은 GPT-5.5의 측정 비용을 약 3분의 1 높였으며, 이 프롬프트 세금은 이후 모든 호출에 반복됨
- 하루 약 4,000만 건을 처리하면 1,000건당 34달러인 구성은 연간 약 5억 달러, 0.50달러인 전문 모델은 약 700만 달러가 들어 약 98%의 비용 차이가 남
적용하기 좋은 업무와 피해야 할 영역
- 적합한 업무는 정보로부터 결정을 만들어내는 대량 반복 작업임
- 티켓 라우팅
- 문서 필드 추출
- 정책에 따른 제출물 검사
- 상품 분류
- 거래 승인 또는 표시
- 핵심 조건은 각 결정의 옳고 그름을 규칙, 스키마, 테스트, 평가표나 전문가 판단으로 검증할 수 있는지임
- 채점할 수 있는 결정은 모델이 연습할 수 있음
- 합의 없이 토론만 가능한 결과는 이 방식으로 연습할 수 없음
- 빈도와 검증 가능성에 따라 도구를 선택함
- 빈도가 높고 검증 가능한 업무에는 미세조정이 적합함
- 검증 가능하지만 드문 업무에는 프롬프트를 최적화한 프런티어 모델이 적합함
- 검증할 수 없는 결과에는 인간이 개입해야 함
- 문제의 핵심이 판단이 아니라 변하는 사실이라면 빈도와 관계없이 검색 증강이 적합함
- 다음 조건 중 하나 이상에 해당하면 미세조정 후보가 될 수 있음
- 호출 비용과 오류가 실제 비용으로 누적될 만큼 대량으로 발생함
- 모든 결과를 사람 없이 규칙, 테스트, 평가표로 확인할 수 있음
- 전문가들이 정답의 기준에 동의함
- 유능한 모델이 일부 성공하지만 신뢰할 만큼 일관되지는 않음
- 정답이 우연한 추측으로 나올 수 없음
- 추론, 도구 호출, 최종 결정의 여러 단계로 구성됨
- 자체 도구, 스키마, 정책에서 실행됨
- 오류 종류마다 비용이 다름
- 민감한 데이터를 통제 밖 인프라로 보낼 수 없음
- 자체 경계 안에서 모델을 실행하면 프롬프트와 기록이 외부 공급자에게 전달되지 않으며, 모델·평가·데이터를 함께 소유하고 개선할 수 있음
다른 산업의 전문 모델 사례
- Cognition의 프로덕션 소프트웨어 작성·수정 모델은 표준 코딩 벤치마크에서 GPT-5.5를 능가하고 초당 1,000토큰을 스트리밍함
- AT&T는 하루 90만 건의 지원 통화를 요약하고 개인정보를 표시함
- GPT-4o보다 개인정보 탐지 성능이 17% 높음
- GPT-4o 수준 정확도로 사기 사건을 12배 빠르게 검토하고 연간 수백만 달러를 절감함
- LinkedIn의 구직자·채용 공고 매칭 모델은 대체한 GPT 모델보다 4% 정확함
- GPT-4보다 75배, GPT-4o보다 6배 저렴함
- Ambience Healthcare의 의료 청구 코드 모델은 골드 패널 시험에서 전문의 18명보다 정확함
- 기반이 된 프롬프트 방식 o4-mini보다 12%포인트 높음
- Phonely의 전화 응대 모델은 99.2% 정확도를 기록해 GPT-4o의 94.7%를 앞섬
- 이전 GPT-4o 구성보다 응답이 73% 빨랐고, 한 고객은 한 달 만에 인간 상담원 350명을 대체함
- OpenPipe의 이메일·지원 티켓 모델은 지원 QA에서 93%를 기록해 OpenAI o3의 50%를 앞섬
- o3보다 64배 저렴하고 5배 빠름
- Perplexity Sonar는 출처를 포함한 검색 답변에서 블라인드 사용자 시험 기준 GPT-4o와 대등함
- GPT-4o보다 10배 빠르고 가격도 낮음
- Checkr의 범죄 기록 분류 모델은 가장 어려운 사례에서 GPT-4를 능가함
- 기존 GPT-4 구성보다 5배 저렴하고 30배 빠름
- 각 수치는 해당 기업이 교체하거나 경쟁한 프런티어 모델을 기준으로 자체 보고한 결과임