- TurboFieldfare는 전체 14.3GB 모델을 메모리에 올리지 않고 Gemma 4 26B-A4B를 약 2GB의 메모리로 실행해, 8GB Apple Silicon Mac에서도 로컬 추론이 가능함
- 1.35GB 공유 코어와 FP16 KV 캐시만 상주시킨 뒤 토큰마다 필요한 MoE 전문가 가중치를 SSD에서 스트리밍하며, 16슬롯 LFU 캐시와 병렬
pread로 입출력을 제한함 - Gemma 4 26B-A4B는 토큰당 약 3.88B 파라미터를 활성화하며, 측정된 디코딩 속도는 8GB M2 MacBook Air에서 5.1~6.3 tok/s, 24GB M5 Pro에서 31~35 tok/s임
- Swift 6.2와 Metal 4로 구현된 전용 런타임이며, 네이티브 Mac 앱·CLI·설치 도구·실험적 OpenAI 호환 서버를 동일한
.gturbo모델 디렉터리 위에서 제공함 - 현재 범위는 macOS 26 이상과 최소 8GB RAM을 갖춘 Apple Silicon Mac의 텍스트 전용 추론으로 한정되며, 이미지·음성·영상과 원격 서버 인증·TLS는 지원하지 않음
메모리를 줄이는 실행 구조
- TurboFieldfare는 instruction-tuned Gemma 4 26B-A4B를 전체 메모리에 적재하지 않음
- 1.35GB 공유 코어와 FP16 KV 캐시는 메모리에 유지함
- 각 토큰에 필요한 routed expert만 SSD에서 Metal이 볼 수 있는 버퍼로 읽음
- 설치된 텍스트 전용 모델은 약 14.3GB지만, 가중치와 4K KV 캐시가 사용하는 메모리는 약 2GB임
- 모델은 총 26B 파라미터 가운데 토큰당 약 3.88B 파라미터를 활성화함
- 가중치는 group 64 기반 MLX affine 4비트를 사용하며, router는 8비트, 공유 및 routed expert는 4비트임
- MLX나 llama.cpp를 감싼 구성이 아니라 Gemma 4 26B-A4B에 맞춰 만든 Swift·Metal 전용 런타임임
토큰 생성 과정
- 각 Transformer 레이어에서 Metal이 상주 가중치로 attention과 router를 계산함
- CPU는 router가 선택한 상위 8개 expert ID를 레이어별 16슬롯 LFU 캐시와 대조함
- 캐시 미스는 제한된 수의 병렬
pread호출로 채움 - SSD 읽기가 진행되는 동안 Metal은 상주하는 shared-expert 분기를 계산함
- 읽기가 끝나면 shared output과 routed output을 결합함
- 캐시 미스는 제한된 수의 병렬
- 프롬프트 prefill은 최대 128토큰 청크를 사용해 한 번 가져온 expert가 여러 행을 처리할 수 있게 함
- 생성 단계에서는 routed layer 루프를 토큰 단위로 반복함
- KV 캐시는 25개 sliding-window layer에 제한된 순환 저장소를, 5개 full-attention layer에 선형 저장소를 사용함
- 디코딩 attention은 정규화된 K와 V 경로를 분리한 exact split-K/V 방식임
설치와 모델 형식
- 첫 실행에서 Download를 선택하면 고정된 Hugging Face revision에서 약 15GB를 범위 요청으로 내려받음
- 설치기는 원본 체크포인트 전체를 임시 파일이나 메모리에 만들지 않음
- 필요한 바이트 범위를 받아 곧바로
.gturbo레이아웃으로 재패킹함 - 전체 shard나 tensor를 별도로 준비하지 않아 임시 메모리 사용량이 제한됨
- 완성된 설치본은 manifest와 파일 해시 검증을 통과해야 사용할 수 있음
- 필요한 바이트 범위를 받아 곧바로
- 설치 완료 후 모델은 약 14.3GB 저장 공간을 차지하며, 설치 과정 자체는 모델을 메모리에 로드하지 않음
- 런타임은 최종
manifest.json이 있는 완성된.gturbo디렉터리만 허용함 - 중단된 다운로드 재개, 부분 다운로드 상태 삭제, 모델을 로드하지 않는 설치 검증을 지원함
실행 환경과 성능
- 요구 환경은 Apple Silicon Mac, macOS 26, Metal 4, Xcode 26, Swift 6.2 이상임
- 패키지는 arm64 전용이며 이전 macOS와 Metal 버전은 지원하지 않음
- 검증 대상은 8GB M2 MacBook Air이며 모델 설치를 위한 여유 저장 공간과 최초 다운로드용 인터넷 연결이 필요함
- 측정된 디코딩 성능은 다음과 같음
- 8GB M2 MacBook Air: 5.1~6.3 tok/s
- 24GB M5 Pro: 31~35 tok/s
- 처리량은 프롬프트 길이, 생성 길이, 페이지 캐시 상태, 하드웨어에 따라 달라지므로 측정치는 성능 상한이 아닌 기준점임
- 모델 실행 전 메모리를 많이 쓰는 앱을 닫고
memory_pressure -Q로 여유 메모리를 확인해야 함 - 앱, decode service, CLI, 서버, 테스트 또는 다른 로컬 모델 프로세스는 한 번에 하나만 실행해야 함
제공 제품과 사용 방식
- Swift 패키지는 여섯 제품을 제공함
TurboFieldfare: 런타임과 Metal 커널을 포함한 Swift 라이브러리TurboFieldfareMac: 설치와 생성을 위한 네이티브 Mac 앱TurboFieldfareDecodeService: Mac 앱이 사용하는 일회성 로컬 모델·Metal 소유 프로세스TurboFieldfareCLI: 명령행 instruction chat 및 raw completionTurboFieldfareServer: loopback OpenAI 호환 Chat Completions 서버TurboFieldfareRepack: 스트리밍 설치 및 설치 검증 도구
- Mac 앱에서는 모델을 내려받은 뒤 Load Model을 선택하고 프롬프트를 입력해 생성함
- 상태 표시줄에서 진행 상황, 디코딩 속도, 메모리 사용량을 확인할 수 있음
- sampling, context length, expert-cache slot과 런타임 옵션을 조정할 수 있음
- CLI의 instruction chat은 JSON 메시지 배열을 받아 Mac 앱과 같은 형식으로 변환함
- 응답 한도인
--max-new의 기본값은 1,024토큰임 - Mac 앱은 선택한 context window가 가득 찰 때까지 생성할 수 있음
- 응답 한도인
--prompt는 채팅 형식을 적용하지 않는 raw completion과 재현 가능한 비교에 사용함- 생성 텍스트는 표준 출력, 시간 통계는 표준 오류로 보내며
--quiet로 통계 출력을 끌 수 있음
프롬프트와 지원 범위
- Mac 앱은 입력을 instruction으로 처리하고 Gemma의 채팅 형식을 자동 적용함
- 기본 sampling 설정은 temperature
0.2, Top-K64, Top-P0.95임- temperature를
0으로 설정하면 결정론적 greedy output을 사용함 - 모델은 반복하거나 잘못 답할 수 있으므로 중요한 결과는 확인해야 함
- temperature를
- 앱과 CLI는 사용자·모델 메시지와 선택적 system guidance를 지원하지만 도구를 노출하거나 실행하지 않음
- 현재 모델 입출력은 텍스트 전용이며 이미지, 오디오, 비디오는 지원하지 않음
- CLI는
--max-context,--temperature,--top-k,--top-p,--repetition-penalty,--seed, 반복 가능한--stop문자열을 제공함
OpenAI 호환 로컬 서버
- 실험적 서버는
127.0.0.1:8080/v1에서 실행되며 Chat Completions, 스트리밍, 함수 도구 선언, 단일 prefix 프롬프트 재사용을 지원함 - 서버는 모델이 만든 tool call을 반환하지만, 모든 도구 호출의 승인과 실행은 클라이언트가 담당함
- 원격 인증과 TLS가 없으므로 서버를 loopback에만 유지해야 함
- Mac 앱, CLI, 서버는 같은
.gturbo디렉터리를 사용하지만 모델을 소유하는 제품은 동시에 하나만 실행해야 함
구현 범위와 실험 기록
- 커스텀 Metal 커널은 양자화 GEMV, attention, MoE, normalization, RoPE, sampling과 프로덕션 fusion을 처리함
- 런타임은 SSD 기반 routed-expert 스트리밍, 제한된 expert 캐시, 청크 단위 단일 프롬프트 prefill, 토큰 단위 생성을 구현함
- 커널, 캐싱, 입출력, prefill, decode에 걸친 103개 측정 결과를 실험 기록으로 관리함
- 실험 문서는 효과가 컸던 최적화, 실패한 아이디어, 더 강한 검증 후 뒤집힌 초기 결과를 포함함
- 향후 작업은 iPhone·iPad 앱 개발과 모바일 추론 속도·메모리 측정, 16GB M4 Mac mini 및 다른 8GB Apple Silicon Mac의 벤치마크임
라이선스와 모델 조건
- 소스 코드와 문서는 Apache License 2.0으로 배포됨
- 모델 가중치는 저장소에 포함되지 않으며 설치기가 고정된 Hugging Face 체크포인트에서 별도로 내려받음
- 가중치에는 원본 배포 조건이 계속 적용됨
- TurboFieldfare는 Google과 제휴하거나 Google의 후원·승인을 받은 프로젝트가 아닌 독립 연구 프로젝트임