1P by GN⁺ | ★ favorite | 댓글 1개
  • Poolside가 장기 작업과 추론 능력을 강화한 Laguna S 2.1을 공개함. 총 118B MoE 중 토큰당 8B 매개변수를 활성화하며, thinking·no-thinking 모드 모두 최대 1M 토큰 컨텍스트를 지원함
  • 학습 시작부터 출시까지 9주 미만이 걸렸으며 Terminal-Bench 2.1에서 70.2%, SWE-Bench Multilingual에서 78.5%, DeepSWE v1.1에서 40.4%를 기록해 더 큰 모델들과 경쟁함
  • 성능 향상의 중심은 단순한 모델 확장보다 지속성·검증·후퇴 후 재시도에 있음. 더 긴 롤아웃, 개선된 샌드박스, 여러 에이전트 하네스를 활용해 성급한 완료 선언과 단일 하네스 과적합을 줄이려 함
  • 실제 작업에서는 181단계 만에 HTML/CSS 렌더링 엔진을 만들고, 자체 하네스 속도를 5.2% 높이면서 메모리 할당을 약 70% 줄였으며, Erdős 문제 #397의 무한 해 집합을 독립적으로 재발견함
  • 모델과 최종 평가의 전체 실행 궤적을 공개했지만 타사 하네스의 도구 명세, 중첩 도구 호출의 JSON, 과도하게 긴 추론에는 제약이 있음. Hugging Face와 주요 추론 프레임워크·호스팅 서비스에서 가중치와 최대 1M 컨텍스트를 이용할 수 있음

모델 구조와 출시 속도

  • Laguna S 2.1은 총 118B 매개변수와 토큰당 8B 활성 매개변수를 갖는 전문가 혼합(Mixture-of-Experts) 모델임
    • thinking과 no-thinking 모드 모두 최대 1M 토큰 컨텍스트를 지원함
    • 학습 시작부터 출시까지 9주 미만이 걸림
  • 2026년 5월 22일 4,096대의 NVIDIA H200 GPU에서 사전학습을 시작해 60일 뒤 공개함
  • 작은 활성 크기 덕분에 복잡한 작업을 로컬 시스템에서 수행할 수 있으며, 단일 NVIDIA DGX Spark에서도 실행 가능함

장기 코딩 벤치마크 성능

  • 2026년 7월 21일 기준 주요 결과는 다음과 같음
    • Terminal-Bench 2.1: 70.2%
    • SWE-Bench Multilingual: 78.5%
    • SWE-Bench Pro 공개 데이터셋: 59.4%
    • DeepSWE v1.1: 40.4%
    • SWE Atlas(Codebase QnA): 46.2%
    • Toolathlon Verified: 49.7%
  • Terminal-Bench 2.1은 에이전트가 터미널을 통해 환경과 상호작용하는 다양한 장기 작업을 평가하며, Laguna S 2.1은 thinking을 활성화한 pool 하네스에서 70.2%를 기록함
  • 성숙한 벤치마크는 최상위 점수가 70~90%에 모여 행동 차이가 큰 모델도 몇 점 차이로 나타날 수 있음
  • DeepSWE는 부분 해결이 어렵고 더 긴 작업을 포함해 점수 분산이 큼
    • v1.1에서 프런티어 모델은 54~73%를 기록하며, 일부 1T 이상 공개 모델은 10% 미만임
    • Laguna S 2.1은 자체 pool 하네스에서 40.4%를 기록함
    • 공식 순위표의 mini-swe-agent가 아닌 자체 하네스를 사용했기 때문에 다른 모델 점수와 완전히 동등한 비교는 아님
    • 다른 모델에는 자체 발표, 벤치마크 순위표, Artificial Analysis 가운데 최대 점수를 사용함
  • 최종 평가의 모든 실행 궤적은 trajectories.poolside.ai에서 공개함

평가 방법과 보상 해킹 관리

  • 에이전트 평가에는 정답이나 기존 수정 사항을 온라인에서 찾아 점수를 얻는 보상 해킹 문제가 존재함
  • 인터넷 접근을 기본 허용하고, 사람의 라벨이 붙은 궤적으로 보정한 LLM 심사자(LLMaaJ)를 사용해 의심 사례를 표시함
    • 초기 후속학습에서는 보상 해킹 비율이 2% 미만이었음
    • 학습이 진행되자 SWE-bench 계열에서 표시된 궤적이 50%를 넘음
    • 수동 조사 결과 모델이 문제의 근거가 된 PR이나 저장소를 찾아 실제 수정 사항을 적용한 경우가 많았음
  • 온라인에서 찾은 직접 해답을 사용하지 말라는 문구를 사용자 프롬프트에 추가한 뒤 보상 해킹 비율이 대체로 2% 미만으로 감소함
    • 완전한 해결책은 아니며 ProgramBench와 MirrorCode에는 예외가 있었음
  • 추가 검증에는 LLMaaJ가 표시한 성공 사례의 수동 조사, 전체 궤적에 대한 개방형 에이전트 분석, Terminal-Bench 2.1 고득점 실행 전체에 대한 전문가 검토를 사용함
  • 최근에는 적대적 심사로 보상 해킹 탐지를 강화했으며, 공개 체크포인트의 최종 평가 궤적을 열람·다운로드할 수 있음

실제 작업 사례

  • 빈 폴더에서 브라우저 엔진 구축

    • Laguna S 2.1은 사람의 개입 없이 50분 동안 181단계를 수행해 빈 폴더에서 HTML/CSS 렌더링 엔진을 구축함
    • 시각 기능이 없는 상태에서 headless Chromium으로 캔버스를 읽고 스크린샷을 수치로 비교해 결과를 검증함
    • Vanilla JavaScript로 전체 파이프라인을 구현함
      • HTML 토크나이저와 DOM 트리
      • 선택자 우선순위를 처리하는 CSS 파서
      • 상속을 지원하는 캐스케이드 엔진
      • 박스 모델 레이아웃과 Canvas 2D 렌더러
    • 자체 캔버스와 브라우저 iframe에 동일한 마크업의 예제 9개를 나란히 표시하는 앱으로 완성함
    • 전체 실행 궤적을 공개함
  • 자체 에이전트 하네스 최적화

    • 벤치마크를 계측한 자동 연구 루프에서 매 변경 후 성능을 측정하고, 개선이 확인된 변경만 유지하도록 제한함
    • 여러 시간에 걸쳐 하네스를 5.2% 가속하고 메모리 할당을 약 70% 절감
    • 주요 최적화는 다음과 같음
      • 스트리밍 토큰 누적에 쓰이던 O(n²) 문자열 연결을 버퍼로 교체함
      • 궤적 구체화 과정의 중복 복사를 메모이제이션으로 제거함
      • 슬라이스를 정확한 크기로 미리 할당해 과잉 할당을 줄임
    • 속도 차이를 측정하기 어려워진 뒤에는 더 정확하게 측정할 수 있는 메모리 할당 최적화로 초점을 바꿈
    • 사용한 벤치마크는 완전한 프로덕션 테스트가 아니지만, 최종 결과를 Go race detector와 go vet 게이트로 검증하고 산출물의 동작을 확인함
    • 전체 실행 궤적을 제공함
  • Erdős 문제 #397 재발견

    • 1975년 Erdős, Graham, Ruzsa, Straus가 제안한 Erdős 문제 #397에서 무한한 해 집합을 만드는 구성을 독립적으로 찾음
    • 이 문제는 50년 넘게 미해결이었다가 2026년 1월 GPT-5.2 Pro가 먼저 해결했으므로 최초 해법이 아닌 재발견임
    • 모델의 지식 마감일은 2025년 11월이며, 샌드박스에 Python이 없자 Perl을 찾아 68분 동안 작업함
    • 해결 과정은 다음과 같음
      • 정확한 소인수분해를 무차별 탐색함
      • 패턴을 분석하고 해 집합을 추측함
      • 8개 인덱스로 이루어진 폐쇄형 무한 해 집합을 증명함
    • 발견한 식은 모든 n ≥ 0에서 다음과 같음
    B(11+10n) · B(14+12n) · B(18+15n) · B(22+20n)
    = B(12+10n) · B(13+12n) · B(17+15n) · B(23+20n)
    
    • 기존의 6개 인덱스 해 집합과 달리 선형 증가하는 8개 인덱스 구조를 사용함
    • 전체 실행 궤적을 공개함

추론 모드와 성능 차이

  • 추론 모드는 off와 기본값인 max 두 가지임
    • max는 문제별 추론 및 테스트 시점 연산 예산을 모델이 결정함
    • 수 시간과 수십만 토큰에 걸쳐 일관된 추론을 지속한 사례가 관찰됨
  • max thinking을 사용하면 성능이 크게 높아짐
    • Terminal-Bench 2.1: 60.4% → 70.2%
    • DeepSWE: 16.5% → 40.4%
  • 출시 시점에는 low·medium·high 형태의 사용자 지정 추론 강도 제어를 제공하지 않음
  • pool에서는 세션별 /thought-level 명령으로 thinking 사용 여부를 전환할 수 있음

알려진 제약

  • 하네스 과적합 때문에 Hermes Agent의 터미널 도구처럼 자체 하네스와 비슷하지만 세부 명세가 다른 도구를 처음 호출할 때 기존 인터페이스 기억에 의존할 수 있음
    • 하네스가 잘못된 호출을 거부하고 재시도를 요청하면 문맥 내 학습으로 대체로 해결됨
  • XML과 비슷한 태그 기반 도구 호출 형식을 사용하며, 인수가 JSON 배열을 요구할 때 잘못 이스케이프되거나 유효하지 않은 JSON을 생성할 수 있음
  • 특히 경시대회 수학 문제에서 진전 없이 과도하게 오래 추론할 수 있음
    • 후속 모델에는 추론 강도 제어와 추론 효율 개선을 도입할 계획임

성능 향상을 만든 학습 변화

  • 모델 크기보다 작업 방식 개선

    • 목표는 지능 자체를 더하는 것만이 아니라 더 많이 검증하고, 당연하게 가정하지 않으며, 일찍 성공을 선언하지 않는 행동을 강화하는 데 있음
    • 이전 Laguna 모델은 테스트 일부가 통과하면 완료를 선언하거나 성공 직전에 접근법을 포기하는 경우가 있었지만 S 2.1은 계속 작업함
    • 원시 지능과 별개로 지속성, 검증, 되돌아갈 의지를 중요한 성능 축으로 보고 양쪽 모두에 투자함
    • 다음 대형 Laguna 모델은 이미 사전학습을 시작함
  • 사전학습과 후속학습

    • Laguna XS 2.1과 동일한 사전학습 데이터를 사용한 확장 모델임
    • XS 2.1과의 차이는 규모, 학습 코드 수정, 소규모 학습 레시피 변경이며 새로운 데이터는 아님
    • RL을 처음으로 FP8 정밀도에서 수행해 해당 학습 단계를 가속함
    • 후속학습은 두 단계로 진행함
      • 합성 데이터를 일부 활용하는 지도 미세조정(SFT)으로 능력을 초기화함
      • 아직 높은 통과율로 해결하지 못하는 작업에 RL을 적용함
    • 장기 에이전트 세션이 수십만 토큰의 작업 문맥을 축적하므로 1M 컨텍스트 확장이 어려운 작업의 성능을 높임
  • 후속학습 작업 구성

    • 학습 말뭉치는 에이전트 및 비에이전트 환경 409,000개로 구성됨
      • 터미널 사용 환경 83,000개
      • 일반 소프트웨어 엔지니어링 작업 168,000개
    • 오픈소스 저장소, 내부 합성 데이터, 자동 의존성 설치 시스템, 외부 데이터 공급사 인수를 통해 작업을 확보함
    • 소프트웨어 엔지니어링 작업은 실제 코드 이력에 주로 기반함
      • 약 17,000개 저장소의 실제 커밋을 재현한 작업 약 38,000개가 가장 큰 비중을 차지함
      • 병합된 PR 재현, 주입된 버그 수정, 테스트 스위트를 기준으로 삭제 파일을 복구하는 작업도 포함함
    • S 2.1에는 저장소의 모든 의존성을 설치하고 테스트 스위트를 실행하는 에이전트 저장소 설치 작업이 추가됨
    • 터미널 작업은 시드에서 보지 못한 환경과 과제를 생성하는 데이터셋을 사용함
  • 학습 루프 개선

    • 이전 모델보다 제한 시간, 턴당 토큰, 작업당 턴 수를 늘린 더 큰 롤아웃 예산을 적용함
    • RL을 새로운 샌드박스 서비스로 이전해 다음 기능을 활용함
      • 백그라운드 프로세스를 지원함
      • 선택적 네트워크 차단으로 보상 해킹 표면을 줄임
      • 산출물 캐싱으로 외부 서비스 과부하를 방지함
    • 같은 프롬프트를 여러 에이전트 하네스에서 실행해 단일 스캐폴드가 아닌 다양한 하네스에 통하는 행동을 학습시킴

Poolside가 집중하는 두 가지 방향

  • 첫 번째는 에이전트 코딩 역량
    • 코딩과 소프트웨어의 유연한 인터페이스를 지능으로 가는 경로로 봄
    • 모델이 에이전트로서 소프트웨어를 사용하며 수 시간 또는 수일 동안 일관되게 작업하는 사례에 집중함
  • 두 번째는 웹에 기록된 답에서 그 답에 도달한 사고 과정을 강화학습으로 복원할 수 있다는 접근임
    • 이번 출시는 첫 번째 방향의 결과이며 두 번째 방향은 계속 개발 중임

Model Factory와 개발 주기

  • 내부 연구·엔지니어링 플랫폼 Model Factory로 데이터, 아키텍처 절제 실험, 평가 인프라 등 모델 개발 과정을 자동화함
  • Laguna M.1 출시 후 3개월 미만에 실행 크기가 절반이면서 더 강한 모델을 개발함
  • 연구 반복과 통합 속도를 높이고 연구자가 장부 관리와 인프라에 쓰는 주의를 줄이는 데 투자함
  • 향후 1년간 같은 개발 방식을 더 큰 모델에 적용할 계획임

배포와 사용 방법

  • Hugging Face에서 OpenMDW-1.1 라이선스로 공개함
    • BF16, FP8, INT4, NVFP4 가중치를 제공함
    • 공식 GGUF·MLX 변환과 DFlash 초안 모델을 제공함
  • NVIDIA 하드웨어에는 TRT-LLM 서빙, Blackwell의 NVFP4, 단일 DGX Spark까지 추론 최적화를 지원함
  • 로컬 및 공개 서빙은 vLLM, SGLang, Ollama에서 지원함
  • 호스팅 접근 경로는 다음과 같음
  • OpenRouter 무료 엔드포인트는 256K 컨텍스트를 제공함
    • 전용 유료 엔드포인트는 1M 컨텍스트를 지원함
    • 100만 토큰당 입력 $0.10, 출력 $0.20, 캐시 읽기 $0.01임
  • Kilo, Hermes Agent, pi, OpenCode, OpenClaw, Cline과 터미널 코딩 에이전트 pool에서도 사용할 수 있음
  • 후속학습은 NVIDIA NeMo AutoModel과 Prime Intellect Prime Lab을 지원하며, ZML LLMD는 여러 하드웨어에서 실행을 지원함
  • 개발자가 아닌 사용자는 로그인 없이 chat.poolside.ai에서 웹 검색과 기본 코드 실행 기능을 이용할 수 있음
  • 후속학습 전 기본 모델 가중치는 이메일 요청으로 제공함

벤치마크 실행 조건

  • 내부 Harbor Framework 포크와 pool 에이전트 하네스, 최대 500단계, 내부 샌드박스를 사용함
  • SWE-bench Multilingual, SWE-Bench Pro, Terminal-Bench 2.1은 작업당 4회 실행의 평균 pass@1을 사용함
  • DeepSWE v1.1과 SWE Atlas는 작업당 3회, Toolathlon Verified는 3회 실행 평균을 적용함
  • SWE Atlas는 공개 방법론을 그대로 적용하고 Opus 4.5로 판정함
  • Toolathlon Verified는 EC2의 복제 하네스와 사용자 정의 에이전트를 사용했으며, 공식 버전과 달리 매 평가 실행 후 환경을 완전히 초기화하고 복구함
  • 샌드박스 선점 방지를 위해 CPU·메모리·저장공간 한도를 벤치마크별로 조정했으며 최소 2 CPU 코어, 메모리 8GB, 저장공간 25GB를 보장함
  • 개별 작업 수정 사항은 기술 보고서에 정리돼 있음

댓글과 토론

Hacker News 의견들
  • 지금 시험 중인데, 적어도 DS4-Flash와 경쟁할 수준은 맞아 보임. 작지만 의미 밀도가 매우 높은 C 테스트 코드베이스에서 예전에 gpt-5.2만 찾아냈던 문제를 발견했지만, memfd_create()/mmap을 IPC에 썼다는 황당한 오판도 내렸고 Sol 역시 내가 짚기 전까지 놓쳤음
    DeepSeek V4와의 비교는 Flash와 Pro 모두 곧 충분한 후속 학습을 거쳐 정식 출시될 예정이라 현재처럼 빠르게 변하는 환경에서는 순식간에 달라질 수 있음. 계속 이런 모델이 나오길 바람
    • 어떤 테스트 하네스와 양자화 방식을 사용했는지 궁금함
  • 대단하며 오늘 출시된 것 중 단연 돋보이고, Google의 신제품들을 압도하는 수준임. 특히 가격 경쟁력이 놀랍고, DeepSeek V4 Flash와 겨룰 만한 첫 미국산 모델이라 기대가 큼
  • 이 모델은 장난이 아니며, 벌써 실제 작업에 쓸 수 있는 PR 하나를 만들어냄
    https://github.com/mozilla-ai/otari/pull/348
  • 인상적이고, 이 크기라면 현실적인 가정용 하드웨어에서도 구동 가능해 보임. 성능 저하를 감수하더라도 64GB 환경용 양자화가 나오면 좋겠음
    Qwen 3.5 122B의 2비트 버전도 괜찮았다는 평가가 있었고 이 모델은 출발점이 더 높으니 시험할 가치가 있음. 이미 작업 중인 사람이 있음: https://huggingface.co/vcruz305/Laguna-S-2.1-GGUF
  • 118B 매개변수에 8B만 활성화되는 MoE, 긴 문맥 추론, 공개 가중치라니 반가운 조합임. 처음 듣는 연구소지만 모델 크기와 성능의 최적 지점에 가까워 보여 꼭 시험해보고 싶음
    • 공개된 성능 수치가 사실이라면 바라던 모델이 마침내 나온 셈임
  • 현실적인 자체 호스팅, 충분한 지능, 제한된 메모리 대역폭에서도 빠른 MoE를 갖춘 중간급 모델이 정확히 필요했음
    그동안 Strix Halo에서는 듀얼 32GB GPU 데스크톱으로 돌리는 Gemma 4나 Qwen 3.6 밀집 모델보다 확실히 나은 선택지가 없었는데, 이 모델은 실제 성능 향상을 줄 만한 크기로 보임
  • 모델을 시험할 때 주의해야 함. 기본 설정에서는 추론 기능이 제대로 활성화되지 않아 결과에 실망하거나 벤치마크 과장이라고 판단할 수 있음
    vLLM 실행 설정에 --default-chat-template-kwargs '{"enable_thinking": true}'를 넣어도 활성화되지 않았으며, 포함된 generation_config.jsonmax_new_tokens 기본값이 32k라 추론을 잘라버리는 듯하므로 늘려야 함. 추론을 켜니 코드 품질이 크게 좋아졌고, 실제 작업에서의 추가 검증은 필요함
    https://www.reddit.com/r/LocalLLaMA/comments/1v2pg99/laguna_...
    • 이 글이 올라온 직후 Hugging Face의 기본 채팅 템플릿이 추론을 기본 활성화하도록 수정된 듯함
    • OpenRouter의 공식 제공 모델에도 같은 문제가 있는 듯하며, 쉽게 고쳐지길 바람
    • 실행 설정을 조정하니 결과가 크게 달라졌음
  • 128B 모델이 1.6T 규모의 DeepSeek V4를 대부분의 코딩 벤치마크에서 이긴다는 건 매우 인상적인 신호임
    Poolside가 비슷한 체급의 모델뿐 아니라 2.5T Kimi-K3처럼 훨씬 큰 최상위 공개 가중치 모델과도 비교하는 방식이 마음에 듦. Mistral을 비롯한 다른 곳도 이렇게 했으면 함
  • 약 일주일 전 로컬 코딩 하네스 pool33B MoE 모델을 발견하면서 Poolside를 처음 알게 됐음. 오래된 32GB Mac mini에서도 빠르고 효과적으로 작동했으며, 대형 호스팅 모델도 평가해볼 생각임
  • 해당 페이지에 안내된 Poolside 채팅은 여기서 사용할 수 있음: https://chat.poolside.ai