본문으로 건너뛰기

MacinAI Local: Mac OS 9을 위한 모델 독립적 LLM 추론 엔진 구축기

2002년형 PowerBook G4와 같은 빈티지 매킨토시 하드웨어에서 GPT-2, Qwen 등의 LLM을 로컬로 실행하기 위해 C89로 개발된 커스텀 추론 엔진과 AltiVec SIMD 최적화 기법을 다룹니다.

섹션별 상세

MacinAI Local은 CodeWarrior Pro 5를 사용하여 C89 표준으로 작성된 모델 독립적 추론 엔진이다. LLaMA 계열(RMSNorm, SwiGLU, RoPE)과 GPT-2 계열(LayerNorm, GeLU, Learned Positional Embeddings) 아키텍처를 모두 지원하며, Python 기반의 내보내기 파이프라인을 통해 Hugging Face 모델을 커스텀 .bin 포맷으로 변환하여 로드한다.
PowerBook G4 Titanium 노트북 앞에 MacinAI Local 설치 CD 두 장이 놓여 있는 모습.
Photo이 이미지는 프로젝트의 실제 구동 환경인 PowerBook G4 하드웨어와 배포 형태(CD-R)를 보여준다. 화면에는 하드웨어 사양을 감지하고 모델을 로드하는 MacinAI Local의 스플래시 화면이 나타나 있어 실제 작동 여부를 시각적으로 증명한다.
Classic Mac OS의 메모리 관리 한계를 극복하기 위해 Arena Allocator를 구현했다. 시스템 시작 시 물리 RAM의 약 88%를 하나의 연속된 블록으로 할당받아 내부적으로 bump-pointer 방식을 사용함으로써 메모리 파편화를 방지한다. 모든 할당은 AltiVec 벡터 로드를 위해 16바이트 정렬을 유지하며, RAM이 부족한 저사양 기기에서는 Transformer 레이어를 디스크에서 순차적으로 읽어오는 Disk Paging 시스템이 작동한다.
PowerPC G4의 AltiVec(Velocity Engine) 유닛을 활용해 행렬-벡터 곱셈 성능을 극대화했다. 4-wide 루프 언롤링과 vec_dstt 명령어를 이용한 캐시 프리페칭을 적용하여 스칼라 C89 코드 대비 최대 7.3배의 성능 향상을 기록했다. 특히 컴파일러의 vec_ld 오프셋 버그를 해결하기 위해 포인터 산술 연산을 사용하고, 비정규화된 부동 소수점 처리를 위해 VSCR 레지스터를 조정하는 등 저수준 최적화가 포함됐다.
100M 파라미터 규모의 커스텀 Macintosh 특화 모델을 3단계로 학습시켰다. Inside Macintosh 등 94,000개 이상의 정제된 매킨토시 관련 문서로 사전 학습(Pre-training)을 진행한 후, AppleScript 생성 및 하드웨어 사양 답변을 위한 SFT(Supervised Fine-Tuning)와 답변 품질 개선을 위한 DPO(Direct Preference Optimization)를 거쳤다.
모델이 생성한 AppleScript를 통해 실제 시스템 작업을 수행하는 에이전트 기능을 탑재했다. 사용자의 의도를 분류하여 파일 복사, 앱 실행, 휴지통 비우기 등의 스크립트를 생성하며, Open Scripting Architecture(OSA)를 통해 이를 실행한다. 생성된 코드의 안전성을 위해 실행 전 사용자 확인 대화상자를 표시하고, 모델의 출력에서 발생하는 토큰 누수(Token Leaking)나 문법 오류를 정제하는 후처리 가드가 작동한다.

기술

  • C89
  • CodeWarrior Pro 5
  • AltiVec
  • PowerPC G4
  • AppleScript
  • Python
  • Hugging Face

활용 사례

  • 빈티지 맥용 로컬 AI 비서
  • AppleScript 기반 시스템 자동화
  • 저사양 기기용 LLM 추론 엔진 교육용 사례

언급된 리소스

AI 분석 전체 내용 보기

AI 요약 · 북마크 · 개인 피드 설정 — 무료

출처 · 인용 안내

원문 발행 2026. 03. 21.수집 2026. 03. 21.출처 타입 RSS

인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.