2P by GN⁺ | ★ favorite | 댓글 1개
  • Windows에서도 Ollama를 네이티브 환경으로 실행할 수 있어, 로컬 대형 언어 모델을 가져오고 실행·생성하는 흐름이 쉬워짐
  • Windows용 Ollama는 내장 GPU 가속, 전체 모델 라이브러리 접근, OpenAI 호환 Ollama API를 함께 제공함
  • 모델 실행에는 NVIDIA GPU와 AVX, AVX2 같은 최신 CPU 명령어 세트를 활용하며, 별도 설정이나 가상화가 필요 없음
  • 전체 모델 라이브러리와 비전 모델을 Windows에서 사용할 수 있고, LLaVA 1.6은 이미지를 ollama run에 드래그 앤 드롭해 메시지에 추가할 수 있음
  • 백그라운드에서 실행되는 Ollama API 덕분에 기존 OpenAI용 도구를 로컬 모델과 연결해 쓸 수 있음

Windows 프리뷰 제공

  • Ollama가 Windows 프리뷰로 제공되어 Windows에서 대형 언어 모델을 가져오고, 실행하고, 생성할 수 있음
  • Windows용 Ollama는 주요 기능을 한 번에 포함함

하드웨어 가속과 실행 방식

  • 모델 실행 시 NVIDIA GPU를 사용해 가속함
  • 사용 가능한 경우 AVX, AVX2 같은 최신 CPU 명령어 세트도 활용함
  • 별도 설정이나 가상화 없이 Windows 환경에서 바로 사용할 수 있음

전체 모델 라이브러리와 비전 모델

  • Windows에서도 전체 Ollama 모델 라이브러리를 실행할 수 있음
  • 비전 모델도 포함됨
  • LLaVA 1.6 같은 비전 모델 실행 중 이미지를 ollama run에 드래그 앤 드롭하면 메시지에 추가할 수 있음

백그라운드에서 동작하는 Ollama API

  • Ollama API는 백그라운드에서 자동 실행되며 http://localhost:11434에서 제공됨
  • 도구와 애플리케이션은 추가 설정 없이 이 API에 연결할 수 있음
  • PowerShell에서 Ollama API를 호출하는 예시는 다음과 같음
(Invoke-WebRequest -method POST -Body '{"model":"llama2", "prompt":"Why is the sky blue?", "stream": false}' -uri http://localhost:11434/api/generate ).Content | ConvertFrom-json
  • Windows용 Ollama도 다른 플랫폼과 같은 OpenAI 호환성을 지원함
  • 기존 OpenAI용 도구를 Ollama를 통한 로컬 모델과 함께 사용할 수 있음

설치와 피드백

  • Windows Preview를 시작하려면 OllamaSetup.exe를 다운로드함
  • 설치 파일 OllamaSetup.exe를 더블 클릭해 설치함
  • 설치 후 터미널을 열고 다음 명령으로 모델을 실행함
ollama run llama2
  • 새 릴리스가 제공되면 Ollama가 업데이트를 안내함
  • 문제가 있으면 GitHub 이슈를 열거나 Discord 서버에 참여해 피드백을 보낼 수 있음

댓글과 토론

Hacker News 의견들
  • 데스크톱에서 Open-WebUI를 프런트엔드로 붙여서 쓰고 있음
    Mistral 파인튜닝 모델 12개 정도와 다른 모델 몇 개를 모아뒀고, 채팅이나 정보 추출 작업에는 충분히 쓸 만함
    Open-WebUI 앱은 ChatGPT와 꽤 비슷하게 생겼고, 대화 검색도 가능함
    https://github.com/open-webui/open-webui

    • 몇 시간 전 발표를 놓친 사람들을 위해 말하면, open-webui는 예전에 ollama-webui라고 불리던 프로젝트의 리브랜딩임
      Ollama용 프런트엔드로 꽤 탄탄하다고 보증할 수 있음. 정말 잘 동작하고 개발 속도도 놀라울 정도로 빠름
      몇 주마다 최신 Docker 이미지를 받아보면 늘 얼마나 개선됐는지 놀라게 됨
      [0] https://github.com/open-webui/open-webui/discussions/764
    • 궁금한데, 그 파인튜닝 모델들은 어디에 쓰고 있음? 직접 가진 데이터로 파인튜닝한 건지, 아니면 작업별로 공개 모델을 골라 쓰는 건지 궁금함
    • 터미널에서 쓸 수 있는 비슷한 도구도 있을까?
  • 늘 그렇듯 AMD GPU 지원 얘기는 없음
    이번에 AMD를 산 게 후회될 정도로 안타까운 상황임

    • AMD GPU 지원은 분명 프로젝트 로드맵에서 중요한 부분임
      아직 ROADMAP.md 같은 곳에 제대로 공개하지 못한 건 아쉽고, 곧 그렇게 할 예정임
      프로젝트 유지관리자 몇 명이 ATI Technologies의 원래 고향인 토론토 지역 출신이라, 개인적으로도 Ollama가 AMD GPU에서 잘 돌아가길 바라고 있음 :)
      AMD 지원 작업에 쓰는 테스트 머신 중 하나는 Radeon RX 7900XT를 사용 중이고 꽤 빠름. 고급형 GeForce 40 시리즈 GPU와 충분히 비교할 만함
      [1]: https://en.wikipedia.org/wiki/ATI_Technologies
    • 나도 같음. 오랜 Linux 사용자로서 Nvidia가 겪게 한 고통 때문에 Nvidia를 매우 싫어해서 AMD가 성공하길 정말 바랐음
      Nvidia를 곧 따라잡을 거라 기대하고 강력한 AMD 카드를 비싸게 샀지만, 실제로는 전혀 그렇지 않았고 AMD가 필요한 자원을 투입하지 않은 탓이라고 봄
      AMD는 바뀔 수 있지만, 지금 당장 시작해야 함
    • AMD는 이 새 유행인 GPU 연산이 곧 지나갈 거라고 믿는 듯해서, 투자할 필요가 없다고 보는 것 같음
      기술 업계에서 본 최악의 자해 행위 중 하나임
    • llamafile은 AMD GPU를 지원함
      Windows에서는 tinyBLAS 라이브러리 덕분에 그래픽 드라이버만 있으면 됨
      https://github.com/Mozilla-Ocho/llamafile/releases/tag/0.6.2
      기본값으로는 채팅 GUI가 있는 브라우저 탭을 열고, 아래처럼 Ollama 같은 명령줄 챗봇으로도 실행할 수 있음
      https://justine.lol/oneliners/#chat
    • 다른 사람들이 말했듯 Ollama는 내부적으로 Llama.CPP를 쓰고, Llama.CPP는 최근 AMD GPU에서도 동작할 예정인 Vulkan 지원을 릴리스했음
      Vulkan 지원으로 컴파일한 llama.cpp를 내 앱 [1]과 함께 써서 AMD 노트북에서 실행하는 데는 성공했지만, Ollama는 머신에서 사용 가능한 GPU를 찾는 방식에 몇 가지 가정을 두고 있어서 작동시키지 못했음
      [1]: https://msty.app
  • Ollama 위에서 쓸 괜찮은 채팅 UI를 찾고 있고, 온라인 모델과 로컬 모델을 모두 지원하길 원한다면 내가 만들고 있는 앱 [1]이 있음
    오프라인과 개인정보 보호에 초점을 맞췄고, 오늘 아침 Windows 지원을 릴리스했음
    [1]: https://msty.app

    • 참고로 Program:Win32/Wacapew.C!ml 탐지가 뜸
    • 주제에서 벗어나지만, 랜딩 페이지는 뭘로 만들었음?
    • 이게 LLM Studio와 비슷한가?
    • Linux 클라이언트 계획도 있음?
    • Gemini API도 추가할 예정인가?
  • 이런 “로컬에서 실행” AI 포트들이 왜 그렇게 많이 서버로 실행되는지 근거가 궁금함
    개발자들이 UI 프로세스 안에서 코드를 실행할 수 있다는 사실을 잊은 건가?
    Stable Diffusion 실행기나 LLM 호스트에서도 같은 패턴을 봄
    꼭 필요하지 않다면 로컬에서 백그라운드 서비스를 돌리고 싶지 않은데, 왜 이런 구현들은 전부 그렇게 동작하는 것처럼 보일까?

    • 정말 흥미로운 질문임. 두 배포 모델 모두 존재할 수 있다고 봄
      좋은 비유는 데이터베이스 엔진일 수 있음. SQLite는 라이브러리이고 Postgres는 장기 실행 서비스인데, 둘 다 널리 쓰이고 각각의 절충점이 있음
    • 다른 사람들이 말한 초기 로딩 시간 외에도, 여러 애플리케이션에서 같은 추론 엔진이나 같은 LLM을 여러 용도로 쓰고 싶을 수 있음
      또 큰 요인이라고 보는 건 머신, 환경, 운영체제를 모델이 효율적으로 돌 수 있는 상태로 만드는 일이 쉽지 않다는 점임
      이 복잡성을 컨테이너, 즉 “서버” 안에 넣으면 초기 설정과 계속되는 개선·업데이트를 따라가는 데 큰 도움이 됨
    • 가중치를 매번 즉석에서 불러오는 건 말이 안 됨. 수 기가비트 규모의 메모리를 계속 옮겨야 하기 때문임
      대신 장기 실행 프로세스가 여러 예측 요청을 처리하는 구조가 맞음
      언젠가 곧 여러 클라이언트에도 제공하게 될 가능성이 큼
    • 이건 개인적으로 좋은 점이라고 봄
      강력한 노트북이나 워크스테이션은 없지만 다중 GPU 헤드리스 서버가 있음
      이런 프로젝트 덕분에 서버에서 LLM을 실험하고, API와 웹 UI를 내부망에 노출할 수 있음
    • 속도 때문에 Ollama를 큰 게이밍 PC에서 돌리지만, 집 안 다른 곳에서도 모델을 쓰고 싶음
      그래서 Open-WebUI는 chat.domain.example에, Ollama는 api.chat.domain.example에 띄워둠. 둘 다 로컬 네트워크 안에서만 접근 가능함
      이 구성으로 노트북과 휴대폰에서는 웹 UI를 통해 최대 속도의 로컬 모델을 쓰고, 실험용 음성 비서를 돌리는 Raspberry Pi는 API 엔드포인트로 Ollama에 질의할 수 있음
      게이밍 GPU 덕분에 모두 최대 속도로 동작함. Stable Diffusion 구성에도 같은 논리가 적용됨
  • Windows 사용자가 Ollama를 못 쓰고 있었다는 걸 몰랐음
    불과 몇 년 전만 해도 Mac 사용자들이 기다려야 했던 쪽이었던 것 같은데

    • 몇 달 전부터 WSL에서는 완전한 GPU 지원까지 포함해 잘 동작했음
      다만 대부분에게 그리 편하진 않았을 뿐이고, 네이티브 Windows 지원은 금상첨화임
    • 한동안 Windows WSL에서 Ollama를 돌려왔음
      결국 x86 Linux라서 모든 게 그냥 잘 동작함
  • 비공개 소스인 LM Studio(https://lmstudio.ai)가 Ollama와 비교해 어떤지 궁금함

    • 좋은 점은 설정이 매우 쉽고, 모델/가중치를 클릭 한 번으로 내려받아 불러올 수 있으며, 아주 잘 동작한다는 것임
      싫은 점은 Windows에서 가중치를 /users/username/.cache 아래 독자적인 디렉터리 구조에 넣어 수십 GB를 잡아먹으면서 알려주지도 않고 다른 클라이언트와 공유하게 해주지도 않는다는 점임
      직접 다운로드한 모델을 가져오게 해주지 않고, 검색 기능이 형편없으며, 인스턴스 설정을 다루는 방식도 마음에 들지 않음
  • 이미 Linux와 Mac에서는 사용 가능해 보임
    이번 변화는 Windows 추가임: https://github.com/ollama/ollama

  • 마침 이런 요구사항들을 직접 설치해보며 살짝 만져보려던 참이었는데, 이 글이 나왔음
    테스트해보니 정말 간단하고 잘 동작한다는 점이 재미있음
    다만 설치 프로그램의 대상 위치를 고르는 옵션이 또 없다는 게 문제로 보임. 서버에 여러 사용자가 있으면 전역 설치 하나가 아니라 각자 개인 복사본을 갖게 됨

  • 글쓰기용 문법/오타 검사 워크플로를 만들 생각으로 Ollama를 돌리고 있음
    Ollama 자체와 직접 관련된 건 아니고, 지금까지 Ollama는 잘 동작함
    혹시 이런 질문을 할 만한 곳이 있을까? LLM용 Stack Overflow 같은 곳이 궁금함

  • 새 Mac Mini에서 llama2 모델을 설치해서 실행해봤는데, 완전한 커널 패닉이 났음. 이게 뭐지?

    • 선택한 모델이 사용 가능한 통합 메모리보다 크면 그런 일이 생길 수 있음
      llama2의 어떤 버전을 골랐고, 통합 메모리는 얼마나 있음?