- Alibaba Qwen이 2.4조 파라미터 규모의 Qwen3.8을 출시하며, 조만간 오픈 웨이트도 공개할 예정
- Qwen3.8은 계속 진화 중인 모델로, 선도적인 프런티어 AI 모델과 호환된다고 밝힘
- Qwen 측은 Qwen3.8을 현재 가장 강력한 모델 중 하나이자 Fable 5 다음 수준으로 평가
- Qwen3.8-Max-Preview는 Alibaba Token Plan, Qoder, QoderWork에서 바로 체험할 수 있음
- Token Plan은 국제 사용자와 중국 사용자를 위한 별도 가격 페이지를 운영함
- 국제 사용자용은 Lite/Standard/Pro 3단계로 제공되며, 프로모션 가격은 각각 월 $6/$18/$68
- 요금제별로 7일당 2,500/10,000/40,000 Credits, 5시간당 700/3,000/12,000 Credits가 제공됨
- 동시에 실행할 수 있는 에이전트는 각각 1~2개/3~4개/6~8개이며, OpenAI/Anthropic 프로토콜을 지원하는 도구에서 API Key와 Base URL로 연결 가능
Qwen 3.8 출시
(twitter.com/Alibaba_Qwen)댓글과 토론
인포그래픽이 있어 가져와 봤습니다: https://i.postimg.cc/63yLvz16/modelsize202607.png
(kimi 걸 살짝 이번 qwen 3.8 내용을 추가해 업데이트)
Hacker News 의견들
-
이번 발표는 Moonshot AI가 2.8조 매개변수 오픈 웨이트 LLM Kimi K3를 7월 27일까지 Hugging Face에 공개하겠다고 발표한 데 따른 것으로 보임
Alibaba도 곧 2.4조 매개변수 Qwen 3.8을 오픈 웨이트로 공개하겠다고 대응했는데, 원래 계획이었는지 Moonshot AI와 경쟁하려고 결정한 것인지는 궁금함
어쨌든 이런 LLM 경쟁의 승자는 사용자임- 동기는 단정하기 어렵지만, 중국 기업들은 지능을 범용재로 만드는 데 힘쓰는 듯함
미국 최전선 연구소의 가치를 떨어뜨리는 가장 효과적인 방법일 수 있으며, 인류에도 매우 유익함 - 중국 소셜 미디어에는 “다른 나라 정부는 반경쟁 행위를 막으려고 개입하지만, 중국 정부는 경쟁을 억제하려고 개입한다”는 농담이 자주 등장함
https://www.reuters.com/business/autos-transportation/what-i... - 지금 발표하는 이유는 World AI Conference가 진행 중이기 때문임
로봇들이 권투를 하고 중국 주요 AI 기업들이 최신 모델을 공개하는 가운데, Xi Jinping이 WAICO 창설도 발표함
https://en.wikipedia.org/wiki/World_Artificial_Intelligence_... - Xi Jinping이 World AI Conference에서 정치적 연합을 출범시키며 “AI 개발은 한 국가의 독주가 아니라 국제 협력의 교향곡이어야 한다”고 말한 시점에 맞춘 발표일 수도 있음
대형 콘퍼런스에는 보통 신제품 공개와 발표가 쏟아짐
https://www.cnbc.com/2026/07/17/x-china-ai-summit-risks-secu... - 거대한 모델보다 Qwen 3.7-27B·122B나 그에 대응하는 3.8 버전을 공개했으면 함
Qwen과 QwQ의 강점은 늘 가정에서 실행할 수 있는 최상급 로컬 추론이었음
- 동기는 단정하기 어렵지만, 중국 기업들은 지능을 범용재로 만드는 데 힘쓰는 듯함
-
Alibaba Cloud가 내 이메일 주소를 차단해 이용료를 낼 수 없으므로 이번에는 펠리컨 테스트를 못 함
오픈 웨이트 공개나 OpenRouter 등록을 기다리는 중임- 펠리컨 벤치마크는 이제 거의 유일하게 신뢰하는 평가 절차임
Alibaba 같은 회사가 돈을 받기 어렵게 만든 것도 황당하며, 유명 개발자들이 자사 모델을 시험하길 원할 법함
OpenRouter에는 대개 빠르게 등록되니 곧 이용할 수 있길 기대함. Qwen 앱을 내려받아 채팅 인터페이스에서 로컬 개발용 MCP 도구로 테스트하는 방법도 있음
- 펠리컨 벤치마크는 이제 거의 유일하게 신뢰하는 평가 절차임
-
Qwen 3.8 소형 모델도 공개되길 바람
35B MoE와 27B 밀집 모델을 로컬에서 사용하는데, 대부분은 Claude까지 호출할 필요가 없음
민감하거나 개인적인 데이터가 포함된 요청에 특히 유용함- 3.6의 35B와 3.5의 122B 사이에 있는 중간급 MoE 모델이 나오면 좋겠음
상당히 강력하지만 지나치게 비싸지는 않은 가정용 컴퓨터에서 속도와 성능의 균형이 뛰어날 수 있음 - 이번 경쟁은 최전선 AI 패권에 더 가까워 보여 유능한 소형 모델은 뒤처질까 우려됨
대형 연구소는 황금알을 낳는 거위를 최종 사용자에게 넘기고 싶어 하지 않으며, Nvidia 같은 하드웨어 업체도 모든 당사자에게서 수익을 얻기 위해 이 시장에 뛰어들 수 있음 - 2.4조 매개변수 모델을 어떻게 35B로 줄이면서 정확도를 유지할 수 있을지 의문임
그렇게 만들려면 완전히 다른 아키텍처가 필요함 - 어떤 하드웨어를 사용하는지 궁금함
- 3.6의 35B와 3.5의 122B 사이에 있는 중간급 MoE 모델이 나오면 좋겠음
-
LMStudio에서 Qwen 3.6 27B를 사용해 보니 조금 느렸지만 기대 이상이었음
mtplx를 적용하니 과장이 아니라 실제로 2~3배 빨라져 매우 인상적이었음
가능한 한 로컬 모델로 옮기고 있는데 점점 실용적인 선택이 되고 있음. 다만 최대 사양 M5 Max MacBook이라는 6,000달러짜리 노트북을 사용하므로 아직 대부분에게 부담스러운 하드웨어임
앞으로는 더 집중적으로 훈련한 소형 모델을 로컬에서 실행하는 방향으로 갈 듯함. 클라우드 제공업체에 모든 데이터를 넘기는 위험이 너무 크고, 수익을 증명해야 할 때가 오면 터무니없는 요금을 매길 것으로 예상함- 최근 가격 인상 이후라면 그 노트북은 이제 8,000달러에 가까울 가능성이 큼
-
한 달간 매일 사용해 본 Qwen 3.7 Pro는 사실상 쓸 수 없었음
시간을 지나치게 낭비하고, 작업 방향을 잃거나 무의미한 반복에 빠지며, 디버깅도 제대로 못 함
DeepSeek V4 Pro와는 차이가 극명했고 지금까지 Qwen이 소프트웨어 엔지니어링에 가장 나쁜 모델처럼 보였음. DeepSeek보다 훨씬 비싸면서 작업을 위임할 수도, 실시간 저수준 작업에 쓸 수도 없었음- Q8로 양자화한 Qwen3.6-35B와 27B를 llama.cpp에서 로컬로 실행했고, antirez의 DS4-flash 양자화 모델도 사용해 봄
모두 비슷한 수준이었고 DS4가 조금 더 효율적이었지만, Bash 스크립트·디버깅·Python·일부 C++ 작업에서는 모두 매우 좋은 결과를 냈음
Qwen이 어떤 애플리케이션이나 언어에서 실패했는지 궁금함. Qwen의 채팅 템플릿이 망가져 있어 직접 디버깅해야 했고 이를 고치려는 작업도 진행 중인데, Gemma에서도 비슷했음 - 내 기준으로 Qwen 3.7 Max는 Opus보다 뛰어나면서 훨씬 빠르고, Fable보다는 약간 떨어짐
DeepSeek 4 Pro보다 속도와 전반적인 이해력에서 크게 앞섰으며 주로 Claude Code에서 함께 사용함
Qwen 3.7 Plus도 하위 에이전트용으로 꽤 괜찮고 Sonnet보다 훨씬 나음. Qwen 3.8 Max Preview도 현재는 잘 작동하지만 판단하기엔 이르며, 정상가의 10%라면 엄청난 가성비임 - Qwen 3.7 Pro는 평범하지만 3.7 Max는 매우 좋은 모델임
- DeepSeek API에 2달러를 충전하고 Void Editor에 키를 넣어 HTML로 암호화폐 도구를 만들었음
수백 줄짜리 CSV 예제 파일을 사용해 한두 시간 가볍게 코딩하고 버그를 수정했는데 약 1.8달러가 들었음
이런 비용이 정상이라면 한 달간 업무에 사용했을 때 월급보다 더 들 것 같은데, 클라우드 제공업체가 정말 이 정도로 비싼지 궁금함 - Anthropic이 지식 증류 공격을 방해하지 말았어야 함
- Q8로 양자화한 Qwen3.6-35B와 27B를 llama.cpp에서 로컬로 실행했고, antirez의 DS4-flash 양자화 모델도 사용해 봄
-
DeepSeek 4 최종 버전도 곧 출시될 예정임
아마 Opus 4.8 수준일 것이며 DeepSeek의 가격을 고려하면 상당히 큰 사건이 될 듯함- DeepSeek의 가격 대비 성능은 압도적임
최근 V4 Flash를 자주 사용하는데 상당히 좋음 - DeepSeek V4는 대부분 모델보다 10~30배 저렴하면서 대다수 작업에 충분함
- 내일이 WAIC 마지막 날이므로 그때 출시될 가능성이 가장 큼
- 가장 기대하는 모델임
최근 몇 주간 DeepSeek Pro를 직접 사용하면서 훨씬 뛰어난 모델에서 나온 것이 분명한 응답을 점점 자주 받았음
성능이 너무 좋다 보니 폐쇄형 모델 진영에서는 이미 “다크 라우팅”이나 “Fable을 그대로 훔쳤다”는 식의 공포·불확실성·의심을 퍼뜨리고 있음
인상된 가격조차 엄청난 가치를 제공함. 모든 모델을 시험할 시간이 없어 현재 최고로 보이는 것만 쓰고 싶다면 오히려 사용하지 않는 편이 나을 수 있음. 올해 상반기에 OpenAI 대신 DeepSeek에 1,200달러를 썼다면 얼마나 더 많은 일을 했을지 깨닫고 후회하게 될 것임
- DeepSeek의 가격 대비 성능은 압도적임
-
Artificial Analysis를 확인해 보니 Anthropic이 12월에 공개해 최근의 가속을 촉발했다고 평가받는 Opus 4.5보다 성능이 좋다는 제공업체가 최소 12곳이었음
전환 비용까지 낮다는 점을 고려하면 경쟁이 완전히 과열된 상태임. 개인적으로 Opus 4.5 수준이면 대부분의 애플리케이션과 용도에 충분하다고 봄- 그래서 OpenAI와 Anthropic은 정부 규제와 금지 조치를 더 강하게 요구할 가능성이 큼
그렇지 않으면 이들의 수익 모델 전체가 무너짐
- 그래서 OpenAI와 Anthropic은 정부 규제와 금지 조치를 더 강하게 요구할 가능성이 큼
-
Qwen Cloud Token Plan으로 OpenCode에서 실행하려면 아래 설정이 작동함
정확한 제한을 몰라 Qwen 3.7 Max의 한도와 동일하게 지정했음"provider": { "alibaba-token-plan": { "models": { "qwen3.8-max-preview": { "limit": { "context": 1048576, "output": 65536 }, "modalities": { "input": ["text"], "output": ["text"] }, "name": "Qwen3.8 Max Preview" } } } }- API 엔드포인트와 토큰을 정확히 선택해야 함
올바른 엔드포인트를 호출하면 할당량이 거의 즉시 줄어드니 이를 확인할 필요가 있음
잘못하면 멤버십 Credits에 포함되지 않는 API 토큰을 소진해 3일 만에 200달러가 나갈 수도 있으며, Alibaba Cloud 가입 보너스로 받은 200달러를 사용한 경우도 마찬가지임
- API 엔드포인트와 토큰을 정확히 선택해야 함
-
“Fable 5 다음으로 뛰어나다”는 표현은 꽤 의미심장함
초기에 Fable이 Opus보다 거의 발전하지 않았다는 회의론이 많았지만, 좋든 싫든 Anthropic은 사용을 계속 허용한다는 전제에서 그 모델로 실질적인 해자를 확보했음
오픈 모델이 이를 능가하면 정말 흥미로울 것임- 해자라고 하기는 어렵지만 확실히 더 좋은 모델임
내 작업에서는 Fable > K3 > Sol 순으로 평가함
다만 Fable을 더는 못 쓴다고 심각한 타격을 받을 만큼 다른 두 모델보다 압도적이지는 않음. 셋 모두 훌륭하고, 정기적으로 요청을 거부하는 모델은 Fable뿐임 - 이들의 “해자”는 Mythos가 현재 유일한 초대형 모델이라는 데 있음
10조 매개변수 모델을 훈련해 1조 모델보다 10% 높은 성능을 얻는 일은 언제나 가능했음
Mythos가 이전 Opus와 같은 크기와 가격의 Opus 5였다면 결정적인 차별점이겠지만 실제로는 그렇지 않음 - 더 좋은 모델이더라도 제약이 너무 많아 Opus만큼 유용하지 않음
- Fable은 결과물의 품질이 자주 떨어짐
Sol을 주력으로 사용하며, Fable은 창의적일 수 있지만 토큰을 끝없이 소모하지 않고 안정적으로 작업을 수행하는 데는 약함
- 해자라고 하기는 어렵지만 확실히 더 좋은 모델임
-
중국의 AI 경쟁이 뜨거워지고 있음
Anthropic과 OpenAI가 다음에 무엇을 내놓을지 기대됨