# 오픈 웨이트 AI가 Kubernetes의 순간을 맞고 있음

> Clean Markdown view of GeekNews topic #31812. Use the original source for factual precision when an external source URL is present.

## Metadata

- GeekNews HTML: [https://news.hada.io/topic?id=31812](https://news.hada.io/topic?id=31812)
- GeekNews Markdown: [https://news.hada.io/topic/31812.md](https://news.hada.io/topic/31812.md)
- Type: GN+
- Author: [xguru](https://news.hada.io/@xguru)
- Published: 2026-07-26T08:27:29+09:00
- Updated: 2026-07-26T08:27:29+09:00
- Original source: [tobi.knaup.me](https://tobi.knaup.me/2026-07-25-open-weight-ai-is-having-its-kubernetes-moment/)
- Points: 1
- Comments: 1

## Topic Body

- 충분한 성능과 이식성을 갖춘 **오픈 웨이트 모델**은 개발자·클라우드·기업이 함께 확장하는 기반이 되어, 단일 공급자가 따라가기 어려운 혁신 생태계를 만들 수 있음
- Kubernetes가 공통 인터페이스 위에 네트워킹·스토리지·관측성 도구를 끌어모았듯, AI에서도 모델 서빙·미세조정·에이전트 런타임·평가로 이어지는 **프로덕션 스택**이 성장하고 있음
- Hugging Face의 공개 모델은 200만 개를 넘었고, GLM-5.2는 자체 SWE-bench Pro 평가에서 **62.1%** 로 GPT-5.5의 58.6%를 앞섰으며 Kimi K3도 독립 평가에서 Opus 4.8·GPT-5.5와 비슷한 점수를 받음
- 중국산 오픈 웨이트 모델을 광범위하게 금지하면 세계의 개발은 계속되는 반면 미국 연구자와 기업만 생태계에서 배제되고, 지난 1년간 Hugging Face 다운로드의 **41%** 를 차지한 중국 모델 주변으로 혁신이 축적될 수 있음
- 미국은 금지보다 상업적으로 활용 가능한 최전선 모델 공개, 이식성과 상호운용성을 중시하는 정부 조달, 전체 도구·운영 계층 구축, **독립 안전성 시험과 표준**으로 경쟁해야 함

---

### Kubernetes가 보여준 개방형 플랫폼의 힘
- Mesosphere는 Apache Mesos를 기반으로 오픈 소스 클라우드 네이티브 소프트웨어를 개발하고, 그 주변에 **DC/OS**를 구축해 지원과 독점 기능을 포함한 기업용 배포판으로 상용화함
- 이후 더 새롭고 완전한 오픈 소스 프로젝트였던 **Kubernetes**가 클라우드 네이티브 커뮤니티를 결집하며 Mesosphere를 흔듦
  - 세계적인 분산 시스템·인프라 엔지니어들이 Kubernetes에 경력을 걸었고, Mesosphere의 충성도 높은 커뮤니티 구성원 일부도 이동함
  - 혁신의 중심이 Kubernetes로 옮겨가자 네트워킹, 스토리지, 관측성, 배포 도구, 정책 엔진 등 부족했던 구성요소가 빠르게 개발됨
- 다수의 스타트업과 기존 공급업체가 참여하면서 Kubernetes를 프로덕션에서 운영하는 데 필요한 거의 모든 구성요소가 오픈 소스로 제공됨
  - 클라우드 사업자와 Mesosphere/D2iQ, Rancher, Red Hat, Nutanix는 통합, 기업용 기능, 지원, 운영을 중심으로 사업을 구축함
- Kubernetes의 성공은 단순히 저장소를 공개한 결과가 아님
  - 엔지니어·클라우드 사업자·기업용 공급업체가 고객 요구에 맞춰 확장할 수 있는 **중립적 기반**으로 자리 잡음
  - 공통 인터페이스와 공급업체 중립적 거버넌스는 참여자들이 장기적으로 제품을 구축할 수 있다는 신뢰를 제공함
- 맞춤화 가능한 개방형 플랫폼이 산업의 중심이 되면 단일 공급자가 생태계 전체의 **결합된 혁신 속도**를 따라가기 어려워짐

### 오픈 웨이트와 오픈 소스 AI의 차이
- 흔히 오픈 소스라고 부르는 모델 대부분은 정확히는 **오픈 웨이트** 모델임
  - 학습된 매개변수는 내려받아 수정할 수 있지만, 학습 데이터와 전체 학습 과정은 대개 공개되지 않음
  - 따라서 [Open Source Initiative의 오픈 소스 AI 정의](https://opensource.org/ai/open-source-ai-definition)에는 미치지 못함
- 완전한 오픈 소스가 아니더라도 사용자가 실행하고 수정할 수 있는 산출물 주변에는 생태계가 형성될 수 있음
- Kubernetes와 AI의 구조에는 중요한 차이도 있음
  - Kubernetes 기여자는 실제 소스 코드를 조사·변경하고, 개선 사항을 공유 업스트림 프로젝트에 반영할 수 있었음
  - 모델 미세조정 결과는 일반적으로 같은 방식으로 공유되지 않음
  - 최전선 모델의 가중치를 내려받을 수 있어도 실행에는 값비싼 하드웨어가 필요할 수 있음
  - AI에는 중립적 거버넌스와 공통 인터페이스를 제공하는 **CNCF 같은 조직**이 없음
- 두 생태계의 공통점은 충분한 성능과 이식성을 갖춘 기반이 원 제작자 혼자 만들 수 있는 범위를 넘어 보완적 혁신을 끌어들인다는 데 있음

### 셀프 호스팅에서 모델 플랫폼으로
- 오픈 웨이트 모델을 도입한 첫 번째 이유는 **셀프 호스팅**이었음
  - 기업은 데이터를 직접 통제하면서 자체 클라우드나 데이터센터에서 모델을 실행하기 원함
  - 사용량과 추론 비용이 늘면서 비용까지 직접 통제하려는 요구도 커짐
- 이런 수요를 바탕으로 vLLM, SGLang, llama.cpp, Ollama, MLX 등의 오픈 소스 **모델 서빙 스택**이 형성됨
- 오픈 웨이트는 셀프 호스팅을 넘어 개발자가 모델 자체를 수정하고 재배포할 수 있게 함
- Hugging Face에는 [200만 개 이상의 공개 모델](https://huggingface.co/blog/huggingface/state-of-os-hf-spring-2026)이 등록돼 있음
- Qwen과 Gemma 같은 인기 모델 계열 주변에서는 다양한 파생 산출물이 만들어짐
  - 서로 다른 반도체 아키텍처와 규모를 위한 **양자화·변환 가중치**
  - 코딩, 의학, 법률, 수학, 에이전트 워크플로용 미세조정 모델과 LoRA 어댑터
  - 서로 다른 미세조정 결과를 결합한 모델 병합
  - TensorRT-LLM, vLLM, MLX 등 각종 런타임에 맞춘 모델 변형

### 최전선과 좁아지는 성능 격차
- 과거에는 오픈 모델의 기반 성능이 가장 어려운 코딩·에이전트 작업에 부족해 최전선 경쟁에서 제외하기 쉬웠지만, 그 격차가 빠르게 좁아지고 있음
- Z.ai는 MIT 라이선스로 공개 가중치를 제공하는 [GLM-5.2](https://z.ai/blog/glm-5.2)를 출시함
  - 자체 평가의 SWE-bench Pro 점수는 **62.1%** 로 GPT-5.5의 58.6%보다 높음
  - 다만 결과는 벤치마크와 에이전트 하네스에 따라 달라질 수 있음
- Moonshot은 [Kimi K3](https://www.kimi.com/blog/kimi-k3)가 장기 코딩 작업에서 폐쇄형 최전선 모델에 근접한다며 7월 27일 가중치 공개를 약속함
  - [Artificial Analysis의 독립 평가](https://artificialanalysis.ai/articles/kimi-k3-achieves-3-in-the-artificial-analysis-intelligence-index-comparable-to-opus-4-8-and-gpt-5-5)에서도 Kimi K3는 Opus 4.8·GPT-5.5와 비슷한 점수를 받음
- 기반 모델의 성능이 충분해지면 에이전트 런타임, 코딩 하네스, 샌드박스, 평가, 관측성, 전문 미세조정 프로젝트가 연쇄적으로 성장할 수 있음
- 이 구성요소들은 팀의 작업 부하, 하드웨어, 비용 구조에 맞춰 조정할 수 있는 **프로덕션급 개방형 스택**을 이룸
  - 오픈 웨이트 모델을 오픈 소스 소프트웨어 위에서 실행하는 구조임
  - 모든 벤치마크에서 모든 폐쇄형 모델을 이긴다고 보장할 수는 없음
- 최전선 AI는 인재 경쟁이며, 개방형 생태계는 세계 각지의 인재가 같은 기반 위에서 개발할 이유를 제공함

### 중국 모델 금지가 미국에 미칠 영향
- Kimi K3를 비롯한 강력한 중국 모델이 등장한 뒤 트럼프 행정부는 중국산 오픈 웨이트 모델에 대한 [제한을 검토 중인 것으로 알려짐](https://www.axios.com/2026/07/20/ai-us-china-open-source-kimi)
  - 잠재적 금지 조치가 어떤 형태가 될지는 아직 불분명함
- 중국산 오픈 웨이트 모델 사용을 광범위하게 금지하면 미국 연구자와 기업이 세계적인 AI 연구자·엔지니어가 모이는 생태계에서 스스로 분리될 수 있음
  - 이 생태계에는 많은 중국인 연구자도 참여하고 있음
  - 세계의 개발 활동은 계속되지만 미국 개발자만 접근하지 못하는 결과가 생김
- Qwen 주변에서는 이미 같은 흐름이 나타나고 있음
  - Hugging Face 기준 지난 1년간 중국 모델은 전체 모델 다운로드의 [41%](https://huggingface.co/blog/huggingface/state-of-os-hf-spring-2026)를 차지함
- 최고의 오픈 웨이트 기반 모델이 중국에서 계속 나온다면 Kubernetes 때와 마찬가지로 해당 모델 주변에 **도구와 혁신**이 축적될 수 있음

### 미국이 경쟁할 네 가지 방법
- ## 최전선급 미국 모델 공개
  - 미국 연구소는 스타트업이 실제 제품을 구축할 수 있는 라이선스로 **최전선급 오픈 웨이트 모델**을 공개해야 함
  - 일부 진전은 이미 나타남
  - [NVIDIA Nemotron](https://www.nvidia.com/en-us/ai-data-science/foundation-models/nemotron/)은 NVIDIA의 허용적 라이선스 아래 상업적으로 사용할 수 있음
  - Thinking Machines의 [Inkling](https://thinkingmachines.ai/news/introducing-inkling/), OpenAI의 [gpt-oss](https://openai.com/index/introducing-gpt-oss/), Google의 [Gemma 4](https://deepmind.google/models/gemma/)는 Apache 2.0으로 공개됨
  - 그러나 OpenAI와 Google의 최고 성능 모델을 비롯해 미국 최전선 연구소 대부분의 최강 모델은 여전히 폐쇄형임
- ## 정부 조달로 개방형 시장 조성
  - 정부 조달은 하나의 API 공급업체에 영구적으로 의존하는 시스템보다 **이식성과 상호운용성**을 갖춘 시스템에 수요를 만들어야 함
  - 미국 국방부는 이미 비슷한 접근법을 사용함
  - [Platform One](https://p1.dso.mil/about)은 여러 군사 프로그램이 기반으로 삼을 수 있는 오픈 소스 도구와 기업용 제품을 제공함
  - 같은 조달 방식으로 오픈 웨이트 모델 주변의 혁신을 가속할 수 있음
- ## 모델 외 전체 스택 구축
  - 미국 기업은 모델을 둘러싼 나머지 계층도 구축해야 함
  - 스타트업은 모델을 맞춤화·확장하고 제품에 내장할 수 있음
  - 서빙, 도구, 지원, 운영 계층도 사업 기회가 됨
  - 미국의 주요 반도체 기업은 하드웨어를 계속 개선하고, 하이퍼스케일러와 네오클라우드는 모델과 생태계를 서비스할 수 있음
- ## 금지 대신 시험과 표준 도입
  - 안전성은 제한을 지지하는 가장 강한 근거지만, **전면적 금지**는 지나치게 광범위해 전체 생태계에 대한 접근까지 희생함
  - 더 나은 대응은 최전선 모델을 대상으로 독립 시험과 표준을 마련하는 것임
  - [Kubernetes 적합성 시험](https://www.cncf.io/training/certification/software-conformance/)은 안전성이 아닌 호환성을 검증하므로 AI에 정확히 대응하는 사례는 아님
  - 다만 독립적인 기준과 거버넌스 모델은 참고할 수 있음
  - Demis Hassabis는 이와 유사한 [미국 주도의 독립 표준 기구](https://x.com/demishassabis/status/2076957440109625718)를 제안함

### 개방형 AI 생태계에서의 경쟁 전략
- 미국은 자국 개발자 주변에 장벽을 세우는 대신 중국 모델을 직접 실행하고, 내부를 분석하고, 벤치마크하고, 개선해야 함
- 동시에 더 나은 미국산 대안을 구축해 미국의 AI 스택을 세계에서 가장 도입하기 쉬운 선택지로 만들어야 함
- 미국은 수십 년 동안 세계 최고의 기술 인재를 유치하고 개발할 공간을 제공해 왔음
- 다른 국가들이 더 개방적인 스택을 표준으로 채택하는 동안 이 경쟁력을 **폐쇄형 생태계**로 바꾸면 미국은 스스로 AI 리더의 지위를 포기하게 됨

## Comments



### Comment 62387

- Author: neo
- Created: 2026-07-26T08:27:30+09:00
- Points: 1

###### [Hacker News 의견들](https://news.ycombinator.com/item?id=49048034) 
- **중국 모델 금지**는 기술적으로 불가능해 보임. 가중치는 숫자일 뿐이라 미국산과 중국산을 구별할 수 없고, 출처 기반 금지는 쉽게 우회할 수 있기 때문임  
  결국 모든 공개 가중치 모델을 규제해야 하며, 실제로 주요 AI 연구소나 관계자들이 3~5개월마다 행정부에 오픈소스 모델 금지를 제안했다는 Axios 보도도 있음  
  DRM과 비슷한 라이선스 체계를 강제해 인증된 미국 모델만 자체 서버에서 실행하게 할 수는 있지만, 대형 연구소에 독점권을 주고 파생 모델 배포도 막게 됨. 해외에는 집행하기 어려워 결국 미국인만 제한받을 가능성이 큼
  - 오픈소스 모델 금지는 소프트웨어가 그랬듯 빠르게 **수정헌법 제1조**와 충돌할 것임. 현대판 DeCSS 깃발은 “좋은 가중치는 {...weights go here...}라고 생각한다”는 문자 형태가 될 수 있음  
    대신 중국 기업이나 중국 기업이 소유한 사업자에 추론·AI 서비스 대금을 지급하는 행위는 금지할 수 있음
  - 미국 정부가 중국 공개 모델 기업을 **Entity List**에 올리면 미국과 거래하는 모든 회사가 이들과 거래하지 못하게 됨. 모델의 출처를 완벽히 식별하기 어려워도 처벌이 강하므로 미국 기업은 명백한 중국 모델의 제공·사용은 물론 우회도 시도하지 않을 가능성이 큼
  - 정부 기관이 Hugging Face의 모델 목록을 만들고 접근 제공을 금지하면 충분함. 무서운 법률 문구가 없어도 **금지 목록**만으로 미국 기업과 호스팅 사업자는 해당 모델을 서버에서 실행하지 않게 될 것임
  - 미국 기업에는 준수를 강제해 Hugging Face에서 모델을 내리게 할 수 있지만, 해외에 대체 서비스가 생기면 모두 그쪽으로 이동할 것임. 결국 **미국에 손해인 결과**가 됨
  - 모델도 소프트웨어이므로 FedRAMP 인증이 필요한 고보증 환경에서는 사용을 금지할 수 있음. 하지만 미국에는 **Great Firewall**이 없으므로 인터넷을 통한 반입 자체를 막는 것은 불가능함

- AI 업계에서 가장 이상한 부분 중 하나가 **토큰 가격 체계**임. 2023년 초 GPT-4가 매우 비쌌다가 6개월 뒤 20달러로 상당한 추론량을 쓸 수 있게 된 이유가 불분명하고, 여러 연구소와 공급자의 가격은 수년간 뚜렷한 근거 없이 오르내렸음  
  공개 가중치 모델은 최소한 추론 비용의 기준선을 제공해 가격을 합리화하고 예측 가능성도 높여 줌. Kimi K3가 나와도 원한다면 K2를 계속 쓸 수 있으므로, 공개 모델의 경쟁 압력과 지속성이 사용자에게 유용함
  - 가격은 가용 연산 자원과 경쟁 환경에서 시장이 감당할 수준으로 정해지며, 여러 가격대를 시험해야 발견할 수 있음. 공급자들이 다양한 요금제와 할인을 시험하는 동시에 수요도 변동 중임  
    안정된 성숙 시장에 익숙하면 혼란스럽겠지만 **신생 시장의 가격 변동**은 흔한 특징임
  - GPT-5 출시 뒤 GPT-4o 폐지에 큰 반발이 있었듯, 모델마다 고유한 특성이 있고 일부 용도에서는 이전 모델이 최신 모델보다 나을 수 있음. 연구소들이 **LTS 릴리스**를 제공할 의지가 없어 보인다는 점에서 구형 모델을 계속 실행할 수 있는 능력이 특히 중요함
  - **FlashAttention**의 영향이 매우 컸음
  - 처방약은 비싸고 복제약은 저렴한 것처럼, **연구개발비 회수**를 위한 인위적 가격 부풀리기일 수 있음
  - GPT-4 자체의 가격을 실제로 내렸는지는 의문임. API의 오래된 버전은 여전히 매우 비싸고, Turbo 등 새 모델이 나오며 가격이 내려갔을 뿐임  
    이름에 모두 `gpt-4`가 들어가도 내부 모델이 같다는 뜻은 아니며, 서비스 비용을 낮추려고 상당 부분을 변경했을 수 있음

- Kubernetes 같은 위치에 도달하려면 **학습 데이터가 공개된 AI 모델**을 여러 기업이 공동 개발해야 할 것임. Linux에 기업들이 함께 기여하듯, AI 모델은 사업에 필요하지만 자체 개발은 너무 비싸므로 공개 모델을 사용하고 필요한 기능을 기여하는 방식이 합리적일 수 있음

- OpenAI도 당시 기준으로 우수한 오픈소스 모델 두 개를 공개했음. 20B 모델은 집에서 텍스트 검토나 Bash 스크립트 초안 작성에 훌륭하지만, 120B는 소비자용 하드웨어에서 현실적인 초당 토큰 속도로 돌리기 어려움  
  다만 OpenAI가 이 모델들을 **더 자주 갱신**하면 좋겠음
  - `gpt-oss-120b`는 Strix Halo에서 초당 30토큰 이상, 128GB MacBook Pro M5 Max에서 초당 75토큰 이상으로 실행됨  
    정신적 후속작은 Nemotron 3 계열로 보이지만 이것도 다소 오래됐음: [https://research.nvidia.com/labs/nemotron/Nemotron-3/](<https://research.nvidia.com/labs/nemotron/Nemotron-3/>)  
    더 최신인 Gemma 4도 있음: [https://huggingface.co/collections/google/gemma-4](<https://huggingface.co/collections/google/gemma-4>)  
    또는 Qwen3.6을 선택할 수 있음: [https://huggingface.co/collections/Qwen/qwen36](<https://huggingface.co/collections/Qwen/qwen36>)
  - Sam Altman은 GPT-3 출시 2년 반 뒤 이사회 이메일에서, 로컬로 실행되는 GPT-3급 모델을 만들면 다른 이들의 동급 모델 공개를 억제하고 신규 사업의 자금 조달을 어렵게 할 수 있다고 썼음  
    중국은 기술 수준을 끌어올리려고 공개 모델을 내놓지만, OpenAI와 Sam은 **경쟁자를 억누르려는 목적**으로 공개한다는 차이가 있음
  - OpenAI의 모델은 괜찮지만 출시 당시 Qwen3 Coder A3B 같은 대안보다 경쟁력이 높지 않았음. 스타트업이라면 한동안 후속작도 없던 OpenAI의 첫 모델보다 여러 차례 공개 가중치 업데이트를 제공한 Qwen3를 선택할 이유가 큼  
    미국 연구소의 최전선 모델을 원하는 스타트업에는 현재 **출시 주기**가 지속 불가능함. 미국이 이 시장을 완전히 넘겨주지 않으려면 OpenAI 등이 빠르게 속도를 높여야 함

- 중국이 하드웨어 생산을 확대하기 전까지는 자체 실행이 경제적이지 않지만, 공개 모델이 연구소에 압력을 가한다는 점은 긍정적임. 결국 휴대전화가 대부분의 작업에 충분한 모델을 실행할 수 있게 되면 **Apple이 승리**할 가능성이 큼
  - **Model-on-Chip**이 다가오고 있음. GPU는 범용 연산 장치라 모델 추론에 큰 병목이 있지만, 칩에 새긴 모델은 크게 갱신할 수 없더라도 성능 이득이 막대함  
    최첨단 반도체 공정도 필요하지 않아 비용을 대폭 낮출 수 있음
  - 그렇게 되면 하이퍼스케일러와 Oracle에는 끝이나 다름없으니 그날이 기대됨
  - 거품 이전 가격 기준으로 128GB Strix Halo는 1,400달러에 약 200W를 사용했고, 네 대를 묶으면 1조 매개변수 최전선 모델을 실행할 수 있음: [https://www.amd.com/en/developer/resources/technical-article...](<https://www.amd.com/en/developer/resources/technical-articles/2026/how-to-run-a-one-trillion-parameter-llm-locally-an-amd.html>)  
    노드당 Claude Code 구독료 7개월치로 계산하면 28개월 만에 투자비를 회수하며, 5년 감가상각 기준으로는 클러스터 두 개를 거의 손익분기 비용에 마련해 동시 요청 흐름 두 개를 처리할 수 있음  
    차세대 하드웨어는 이미 발표됐고 무어의 법칙 두 주기 정도 뒤에 출시될 예정이며, 안정된 가격은 2024년 가치 기준 1,400달러 이하이면서 더 빠를 가능성이 큼  
    금융 거품이 꺼지고 연구소의 데이터센터용 하드웨어 구매가 멈추면 **로컬 추론**이 구독보다 저렴하고 매우 실용적으로 바뀔 것임. 그때 UNIX Surplus가 닷컴 붕괴 뒤처럼 추론 서버를 헐값에 팔지, 아니면 전력 요구량이 가정용으로 너무 특수할지가 궁금함
  - 코딩 외 작업이라면 **양자화 모델**을 밤새 실행하는 것으로 대부분의 요구를 충족할 수 있음
  - 집의 데스크톱에서 모델을 실행하고 휴대전화 앱으로 사용 중이며, 모델과 용도에 따라 초당 60~140토큰이 나옴. **음성 대화**를 유지하기에도 충분히 빠름

- 정부가 특정 API 사업자에 영구적으로 종속되기보다 **이식 가능하고 상호운용되는 시스템**을 조달해 수요를 만들자는 방안에는 가치가 있음. 연방정부뿐 아니라 California, Colorado, Illinois, New York 같은 주정부도 시행할 수 있음

- 공개 가중치 모델로 **에이전트형 코딩**을 하는 실제 구성이 궁금함. 어떤 실행 도구와 모델을 쓰고 월 비용은 얼마인지, Claude Code와 Pro 같은 보조금형 요금제와 비교하면 어떤지 알고 싶음  
  공개 모델이 저렴하고 효율적이라는 말이 실제로도 맞는지 확인하고 싶음
  - 예전에는 맞춤 실행 도구를 썼지만 도구들이 좋아져 구성을 크게 단순화했음. 기반 모델도 코드의 어려운 부분에서는 실패하므로 기회가 맞을 때만 활용함  
    Zed에서 로컬 모델 세 개를 사용함: RTX 3090 한 장의 `llama.cpp`에서 128K 문맥 Qwen 3.6 27B가 초당 약 50토큰, Titan V 한 장과 GTX 1080 Ti 두 장의 `llama.cpp`에서 전체 문맥 Qwen 3.6 35B-A3B가 약 30토큰, GPT-OSS 120B는 CPU에서 느리게 실행됨  
    Zed의 병렬 에이전트를 사용해 작업을 전환하고, 모델이 막히면 중단해 코드를 고침. 이 방식으로 집중을 유지하고 유지보수 가능한 코드를 만들면서 목표의 약 **80%** 까지 도달함  
    30년 경력이 있고 코드의 작동 원리를 반드시 이해하려 하므로, 제3자에게 코드 진행을 의존하지 않으면서 단기 이점 대부분을 얻고 있음. GTX 5060 Ti 16GB 두 장이면 널리 구할 수 있는 카드로 Qwen 3.6 35B-A3B에서 초당 약 100토큰이 가능할 것임  
    최신 클라우드 모델은 초안 토큰 등을 사용해 일반 코딩에는 우수하지만, 도메인 특화 작업에서는 성능이 저하됨. 초안 모델 크기가 기반 모델의 10~20%에 불과하고 최고급 Blackwell GPU도 초당 약 250토큰으로 제한되므로, 기반 수준의 성능 확장에는 MoE나 초안 모델이 필요함  
    하지만 내 용도는 분포 외(OOD) 문제나 학습 말뭉치에 예시가 적은 문제라 이런 최적화가 불리함. Lamborghini보다 **미니밴이 필요한 상황**에 가까움
  - Ryzen 5950X, 메모리 128GB, RTX 3060 12GB에서 자체 실행 도구와 `qwen 3.6 35B unsloth 4 bit`를 사용 중임  
    10K 문맥에서는 생성 초당 약 40토큰·프리필 약 500토큰, 100K 문맥에서는 생성 약 25토큰·프리필 약 400토큰이 나옴  
    먼저 GPT나 Claude로 상세한 단계별 계획을 만들고 Qwen이 따르게 하는 경우가 많음. 경제적인지는 확신하지 못하지만 하드웨어가 이미 있고 지붕의 태양광 덕분에 전력은 큰 문제가 아님  
    가장 큰 장점은 모든 처리가 **완전히 로컬**에서 이뤄지고, 실행 도구가 업로드나 원격 측정을 하지 않는다는 사실을 확신할 수 있다는 것임
  - Kimi K3와 OpenCode를 사용하며 API 종량제로 연속 사용 시 세션 1~2개가 시간당 약 1,000만 토큰과 **약 5달러**를 소비함  
    요금제의 제한과 운영 방식을 싫어해 구독형과 비교해 보지는 않았음. Fable, Opus, Gemini보다 눈에 띄게 느리지만 이들의 API 요금보다는 훨씬 저렴함
  - 월 20달러짜리 Ollama Cloud 요금제로 GLM-5.2를 사용 중임. 같은 요금제에서 여러 API 키를 받아 OpenWebUI 서버와 OpenCode, Pi 개발 세션에 쓰고 있으며, 보통 2~4개 세션을 동시에 돌려도 한도에 걸리지 않음  
    직장에서는 Claude를 제공하는데, Opus 사용료가 **업무 시간당 75달러**라는 보고를 받았음
  - OpenCode에서 `GLM 5.2 awq4`를 사용했는데 회사가 선호하는 Sonnet 4.8보다 낫고 Opus 4.8보다는 조금 떨어졌으며, 개발팀이 필요로 하는 작업 대부분에 충분했음. Sonnet 5보다는 못하지만 토큰이 바닥나지 않음  
    반면 실행에 **H200 네 장**이 필요하고, 이 구성으로 문맥을 캐시할 수 있는 사용자는 약 세 명뿐임  
    Blackwell 장비가 도착하고 Kimi 3 가중치가 실제 공개되길 기대함. 개발자들이 급여의 상당 부분을 토큰에 쓰는 지점에서는 터무니없이 비싼 DGX 서버를 직접 구매해 랙에 설치하고 운영하는 편이 오히려 저렴해짐

- 중국 정부가 최고 모델의 학습과 공개를 지원해 OpenAI와 Anthropic에 공개 경쟁 압력을 준다는 해석은 믿기 어려움. 오히려 **중국 정부가 승인한 정보 배포 방식**에 맞도록 최첨단 모델을 강화학습하려는 수단처럼 보임  
  질문에 답하는 불투명한 시스템을 신뢰해야 한다면, 중국 정부가 승인하고 대규모 보조금을 지급한 모델보다 시장 압력을 받는 미국의 영리 상장기업 모델을 선택하겠음
  - 중국이 다른 시장에서 하듯 제품을 덤핑해 경쟁자를 몰아내는 전략과 일치함. 토큰마다 큰 손실을 보고 있다면 적대자가 소비량을 악의적으로 늘려 비용을 키울 수도 있음  
    실물 덤핑은 수요가 유한하고 환경 비용이 크지만, 소프트웨어 수요는 사실상 무한하며 생산 비용과 비교한 환경 비용도 낮아서 **AI 덤핑 역이용**이 가능할 수 있음
  - 중국 모델의 **국가 지원 편향**에 대응할 도구가 무엇인지 궁금함. 개인이 편향을 쉽게 보정할 수 있다면 영리한 전략처럼 보이지 않음

- 중국이 앞으로도 최전선 모델 가중치를 계속 Hugging Face에 올릴 것이라는 전제를 자연법칙처럼 받아들이고 있음. 하지만 중국의 **Mythos 시점**이 몇 달 앞으로 다가왔고, 여러 보도를 보면 중국 역시 비슷하게 대응할 가능성이 큼  
  중국이 Mythos 후속작을 Hugging Face에 올려 모두가 안전장치를 제거하도록 허용하리라고 믿기는 어려움. 상황은 OpenAI와 Anthropic의 예상대로도, 중국의 예상대로도 흘러가지 않았음
  - 충분히 공개할 수도 있음. 중국이 아프리카 전역의 정유소와 시추권을 받는 대가로 도로와 학교 같은 기반 시설을 제공한 사례를 볼 필요가 있음: [https://oilprice.com/Energy/Crude-Oil/China-Is-Rapidly-Expan...](<https://oilprice.com/Energy/Crude-Oil/China-Is-Rapidly-Expanding-Its-Oil-Resources-In-Africa.html>)
