로컬 LLM을 실행하는 도구는 이미 많습니다. 하지만 코드 에이전트와 함께 매일 쓰려면 모델 파일을 내려받는 것만으로는 부족합니다. 내 컴퓨터의 칩과 메모리, 대역폭에 어떤 모델이 맞는지 고르고, 선택한 모델을 에이전트가 실제로 호출할 수 있게 연결해야 합니다. Magnitude는 이 과정을 하나의 CLI와 백그라운드 서버로 묶습니다.
CLI는 머신의 하드웨어를 프로파일링하고 예상 tok/s를 바탕으로 모델을 추천합니다. 선택한 모델은 다운로드와 튜닝을 거쳐 Pi, OpenCode, Hermes, OpenClaw, Codex, Claude Code, Oh My Pi, Cline에 연결됩니다. 요청이 있을 때만 모델을 로드하고, 유휴 상태나 메모리 부족 상황에서는 언로드하는 흐름도 포함합니다.
추천이 곧 품질 보증은 아닙니다. 실제 속도와 에이전트 작업의 정확도는 모델, 컨텍스트 길이, 작업 종류에 따라 달라지고 Windows는 WSL 경로를 사용합니다. 그래도 로컬 모델 선택부터 메모리 관리와 harness 연결까지 직접 조율해야 했던 일을 운영 파이프라인으로 끌어온다는 점은 분명합니다.