ternary weight の 27B モデル「Bonsai 2」を、Mac や GPU、CPU のローカルで動かすデモ。setup.sh で取得し、chat・画像・tool 呼び出しが使える。

できること

  • ./setup.sh でモデルと実行用バイナリを取得する
  • Metal、CUDA、Vulkan、ROCm、CPU で動く
  • 画像や PDF を入力できる
  • OpenAI 形式の tool_calls と MCP に対応
  • 262K トークンの context、reasoning の強さを切り替えられる

使い方

./setup.sh のあと ./scripts/start_llama_server.sh で http://localhost:8080 に chat が立ち上がる。

活用できそうな場面

  • GPU 1枚や Mac で動く、ローカル LLM の検証に使えそう
  • 量子化モデルの速度・品質を手元で確かめるのに使えそう

向いている人

ローカルで大きめの LLM を動かしたい人

似ているもの

  • Ollama / llama.cpp 本家:ローカル実行の定番。Bonsai は専用の fork が要り、本家では動かない

技術

llama.cpp の PrismML fork、MLX。モデルは約 5.9 GB(1.75 bit/weight)、既定の packing では約 1.3 GB 多くなる。

注意点

「FP16 の 98.2% の性能」は作者側の数字で、第三者の検証は材料にない。専用の llama.cpp fork が必要。