1P by GN⁺ | ★ favorite | 댓글 1개
  • Nativ은 Apple Silicon Mac에서 오픈 AI 모델을 내려받아 계정·구독·클라우드 없이 실행하는 MIT 라이선스 오픈소스 앱임
  • Google, Cohere, Liquid AI 등의 모델을 제공하며, Mac 하드웨어에 적합한 모델을 추천하고 모든 응답을 로컬에서 생성
  • 채팅에서 스트리밍·Markdown·코드 강조·이미지 입력을 지원하며, 초당 토큰 수와 메모리 압력 등 성능 상태를 실시간으로 확인할 수 있음
  • MLX-VLM과 M 시리즈의 통합 메모리·Metal에 최적화돼 언어, 비전, 비디오, 코드, 오디오 작업을 처리함
  • 로컬 모델 서버를 Pi, Codex, Claude Code, Hermes, OpenCode와 연결할 수 있고 앱과 모델 로더 전체 코드도 공개함

Mac에 최적화된 로컬 모델 실행

  • Apple Silicon M1 이상을 지원하는 범용 macOS 앱으로, 클라우드나 별도 변환 계층 없이 실제 모델을 Mac에서 구동함
  • 선별된 라이브러리에서 Google, Cohere, Liquid AI의 오픈 모델을 선택할 수 있으며 하드웨어에 적합한 모델도 추천받을 수 있음
  • 채팅 인터페이스는 다음 기능을 제공함
    • 스트리밍 응답과 메시지별 성능 지표
    • Markdown과 코드 구문 강조
    • 이미지 입력
  • 실시간 성능 측정을 통해 초당 토큰 수, 메모리 압력, 발열 상태, 첫 토큰 생성 시간을 확인할 수 있음
  • MLX-VLM을 기반으로 M 시리즈의 통합 메모리와 Metal에 맞춰 조정됨
  • LLM 채팅, 이미지 캡션 생성, 비디오 요약, 코드 자동완성, 음성 변환 및 생성을 지원함
  • 계정·크레딧·구독이 필요 없으며 사용자 데이터를 판매하지 않음

개발 도구 연동과 오픈소스 원칙

  • Nativ의 단일 로컬 엔드포인트를 통해 기존 코딩 에이전트를 Mac에서 실행하는 로컬 모델에 연결할 수 있음
    • Pi
    • Codex
    • Claude Code
    • Hermes
    • OpenCode
  • 데스크톱 앱, 모델 로더, 성능 측정 차트를 포함한 전체 코드를 공개해 열람·포크·Pull Request가 가능함
  • MIT 라이선스로 배포하며 VC 로드맵, 엔터프라이즈 등급, 프롬프트를 학습 데이터로 전환하는 다크 패턴을 두지 않음
  • 전체 모델 라이브러리는 Hugging Face에서 확인할 수 있음

댓글과 토론

Hacker News 의견들
  • 이 MIT 라이선스 앱은 인기 라이브러리 MLX-VLM을 관리하는 Prince Canuma가 만든 것임. MLX-VLM은 Apple 기기에서 llama.cpp보다 빠른 추론을 제공할 수 있어 오랫동안 LM Studio 등의 의존성으로 쓰여 왔음
    MLX 생태계는 CUDA보다 작지만 새 모델, 특히 비전·음성 인식·음성 합성·동영상 생성 같은 다중 모달 모델을 매우 빠르게 지원함. mlx-audio-swift도 참고할 만하며, 이런 모델이 이 UI에 통합돼도 놀랍지 않을 것임
    랜딩 페이지는 바이브 코딩의 흔적이 있을지 몰라도 앱 대부분은 Swift로 작성돼 있어, 이 추론 스택을 iPad와 iPhone으로 이식하기도 쉬워 보임

    • 요즘 Hugging Face에는 거의 모든 인기 모델의 MLX 버전이 올라와 있음. 예를 들어 Qwen 3.6 35B-A3B 기본 페이지에서 양자화 링크를 따라가 평판 좋고 인기 있는 MLX 변형을 고르면 됨
    • 도메인에서 blaizzy를 보고 반가웠음. Prince Canuma의 MLX 관련 작업은 유독 품질이 높았기 때문임
    • GitHub 저장소에 오디오 전용 및 이미지 생성 전용 모델 지원이 곧 추가된다고 적혀 있음. Prince Canuma는 X와 GitHub 이슈에서 답변이 매우 빠르며, 나는 음성 복제에 mlx-audiomlx-community/Qwen3-TTS-12Hz-1.7B-Base-bf16을 거의 매일 사용함
    • 가장 먼저 든 질문은 Unsloth와 비교해 무엇이 다른가였음
    • mlx-vlm은 vllm이나 sglang처럼 최신 샘플러 지원이 형편없어 전환하면 오히려 해로울 수 있음. 나는 min_p 논문의 저자 중 한 명인데, llama.cpp가 훨씬 우수한 top-n-sigma를 지원하는 상황에서 min_p가 최선이라면 속도가 더 빨라도 옮길 이유가 없음
      최신 샘플러를 지원하려면 논문 1, 논문 2, 논문 3부터 살펴볼 수 있음
  • 프런티어라는 표현이 남용되는 것 같음. 지금의 Fable처럼 최고 수준인 모델을 뜻한다고 생각했는데, 그런 모델은 막대한 RAM과 비싼 GPU가 필요해 직접 호스팅하기 어렵지 않나 싶음

    • 여기서는 다목적 최적화 문제의 최선 해 집합인 파레토 프런티어를 뜻하는 듯함. 지능과 가격을 기준으로 하면 같은 수준 이상의 지능을 더 싸게 제공하는 모델도 없고, 같은 가격 이하에서 더 지능적인 모델도 없을 때 프런티어에 속함
      Artificial Analysis 차트를 보면 직관적임. 예컨대 DeepSeek V4 Pro만큼 지능적이면서 더 저렴한 모델이 없으므로 프런티어 모델로 볼 수 있음. 파레토 프런티어의 해는 다른 무언가를 포기하지 않고 더 나은 대안으로 바꿀 수 없는, 자기 체급의 최선임
    • 이 용법은 혼동을 일으켜 동의하기 어렵지만, 일반적으로 프런티어는 여러 개일 수 있으며 그중 오픈 가중치 소형 로컬 모델의 프런티어가 가장 중요하고 흥미롭다고 봄
      Gemma 4 12B를 쓸 때마다 작고 영리하며 효율적인데도 AI 업계의 에너지가 완전히 엉뚱한 방향으로 향한다는 느낌을 받음. 연구비를 16GB 통합 메모리 시스템에서 실행되는 모델 개선에 집중하면 중요한 진전이 가능할 것임
      Qwen 3.6과 BottleCap의 27B 미세조정 모델도 좋지만, 소형 Gemma 4 모델의 놀라운 성능은 충분히 알려지지 않았음. 이 웹사이트가 Qwen 3.6 27B에 프런티어라는 표현을 쓰는 건 부적절해 보여도, 성능상 아주 동떨어진 표현은 아님
    • 프런티어는 매개변수 수, 작업별 성능, 동일 하드웨어에서의 토큰 생성 속도, 활성 메모리 요구량 등 여러 차원의 최적 조합으로 정의됨. 현재 선택지 중 한 지표를 개선하려면 다른 지표 하나 이상이 악화돼야 하는 모델이 프런티어에 해당함
    • 프런티어는 곡선이며, 파레토 프런트를 뜻함
    • 오픈 소스와 최전선의 격차가 Kimi K3 같은 모델로 줄고 있지만, Kimi K3는 매개변수가 2조 개를 넘음. 일반적인 Mac에서 실제로 돌릴 수 있는 Gemma 4 등은 같은 급이 아님
  • 홈페이지가 마치 LM Studio 같은 기존 앱이 없는 것처럼 소개해 놀라움. 얼핏 봐서는 무엇이 다른지 불분명하고 Open WebUI도 빠져 있음
    나는 MacBook Pro에서 Open WebUI와 DS4로 몇 주째 DeepSeek V4 Flash를 로컬 실행 중임

    • LM Studio는 Nativ 개발자가 공개한 코드를 기반으로 만든 폐쇄형 소프트웨어
    • LM Studio도 같은 일을 하지만 오픈 소스가 아님. 따라서 Nativ이 더 제공하는 차별점은 있음
    • “들어본 다른 로컬 AI 앱은 소유하지 않은 오픈 소스 엔진 위에 만든 독점 셸”이라는 문구가 LM Studio를 에둘러 겨냥한 표현임
    • MacBook 사양이 궁금함. 내 Strix Halo에서는 DeepSeek V4 Flash가 에이전트 용도로 쓰기에 너무 느림
  • 이제 프런티어는 Claude Code 사용자라면 알 만한 load-bearing처럼 남용되는 단어가 됐음. 특히 이 앱은 실제 최상위 모델을 Mac에서 로컬 실행하지 못하므로 그만 썼으면 함

  • “아무도 하지 않는데 우리가 오픈 소스인 이유” 같은 마케팅 문구가 마음에 들지 않음. 나는 오픈 소스인 oMLX를 쓰고 있으며 Nativ의 기능을 모두 제공하는 듯함
    존재하지 않는다고 취급한 기존 오픈 소스 경쟁 제품과 제대로 비교했으면 함

    • 아마 LM Studio 같은 선택지가 오픈 소스가 아닌 이유를 말하려던 듯함
  • 작은 로컬 모델을 실제로 어디에 쓰는지 궁금함. 제법 유능해졌지만 재미로 만드는 몇몇 장난감 프로젝트 외의 실제 업무를 맡기기에는 아직 신뢰하기 어려움
    코딩 에이전트에 실제로 쓰는지, 아니면 주로 다른 용도인지 궁금함

    • OpenCode에서 Qwen3.6 27B가 생성한 코드를 프로덕션에 배포한 적 있음. Opus만큼 지식 범위가 넓지는 않지만, 프롬프트와 주변 코드만으로 변경 사항을 완전히 추론할 수 있다면 매우 잘 작동함
      Blackwell GPU용 고성능 추론 엔진처럼 전문 지식이 필요한 코드를 처음부터 쓰기는 어렵지만, 기존 프로젝트에 사용 사례를 추가하는 일반적인 PR은 Sonnet과 비슷한 수준임. 권장 temperature와 top-p 설정, 지나치지 않은 양자화, 최소 15만 토큰 문맥 같은 올바른 구성이 필요함
    • 개인 에이전트의 메모리 그래프 추출에 Gemma 4를 로컬로 사용함. 메시지를 주제, 출처, 사실, 개체 등으로 나누고 NLEmbeddings를 이용한 검색용 그래프에 넣음
      대상 에이전트는 DeepSeek V4 Flash를 사용하며, 로컬 모델은 채팅 에이전트로 쓰기엔 느리지만 메모리 추출에는 꽤 잘 작동해 매 대화 턴의 API 사용량을 줄여줌
    • 코딩 에이전트로는 쓰지 않지만 텍스트 변환·요약·정보 추출에는 매우 유용함. 이미 유료 모델을 구독 중이라면 개인정보 보호 외에 특별한 이득은 없을 수도 있지만, 그 자체도 무시할 가치는 아님
    • 작은 모델도 의존성 업데이트, 병합 충돌 해결, --help, Markdown, README 작성 같은 반복 작업을 충분히 처리함. 실패해도 git restore로 되돌리거나 PR을 거부한 뒤 더 좋은 모델에 다시 맡기면 됨
    • Qwen35ba3b는 비교적 평범한 하드웨어에서도 대규모 데이터 정제를 수행할 수 있음. 3090 GPU 두 장으로 이미 약 1,000억 토큰을 처리했음
  • LM Studio보다 나은 점이 무엇인지, 그리고 MTP 모델도 실행하는지 궁금함. 알기로는 MTP 모델이 GGUF 형식임

  • Rapid MLX로 MLX를 써 봤지만 Qwen이 자꾸 끊기고 같은 내용을 반복했음. llama.cpp로 옮기자 MTP에서 토큰 생성이 더 빨라지고 모델도 안정적이었음
    다른 사람들은 MLX와 llama.cpp를 비교해 어떤 결과를 얻었는지 궁금함

    • M1 Max에서는 MLX의 이점을 거의 보지 못했음. Apple Neural Engine 변경 덕분에 M3 이상에서 이득이 더 클 가능성은 있음
      내가 시험한 모델에서는 llama.cpp의 GGUF 성능이 더 좋은 경우도 있었음. Gemma 4의 MTP는 큰 가치가 없었지만 Qwen 3.6 MoE에서는 측정 가능한 차이가 있었고, 최신 하드웨어라면 더 의미 있을 수 있음
    • 서로 다른 시점에 MLX를 두 번 시험했지만, 매번 llama.cpp보다 상당히 낮은 성능을 보였음
  • 이 용도에 적당한 중간급 Mac 사양이 궁금함. 64GB M5 Pro와 저가형 M5 Air를 사고 클라우드 토큰 비용을 내는 선택 사이에서 고민 중임
    성능이 더 낮은 모델을 로컬로 돌리기 위해 2,000~3,000달러를 더 쓰는 대신 상당한 양의 클라우드 토큰을 살 수 있음

    • M1 Max 64GB에서도 이런 모델을 상당수 실행할 수 있음
  • ds4 위에서 DeepSeek V4를 실행하지 않는 이유가 궁금함. 결과가 상당히 좋을 것 같음

    • Nativ은 DwarfStar 같은 SSD 스트리밍을 지원하지 않는 듯함