ternary weight の 27B モデル「Bonsai 2」を、Mac や GPU、CPU のローカルで動かすデモ。setup.sh で取得し、chat・画像・tool 呼び出しが使える。
できること
./setup.shでモデルと実行用バイナリを取得する- Metal、CUDA、Vulkan、ROCm、CPU で動く
- 画像や PDF を入力できる
- OpenAI 形式の tool_calls と MCP に対応
- 262K トークンの context、reasoning の強さを切り替えられる
使い方
./setup.sh のあと ./scripts/start_llama_server.sh で http://localhost:8080 に chat が立ち上がる。
活用できそうな場面
- GPU 1枚や Mac で動く、ローカル LLM の検証に使えそう
- 量子化モデルの速度・品質を手元で確かめるのに使えそう
向いている人
ローカルで大きめの LLM を動かしたい人
似ているもの
- Ollama / llama.cpp 本家:ローカル実行の定番。Bonsai は専用の fork が要り、本家では動かない
技術
llama.cpp の PrismML fork、MLX。モデルは約 5.9 GB(1.75 bit/weight)、既定の packing では約 1.3 GB 多くなる。
注意点
「FP16 の 98.2% の性能」は作者側の数字で、第三者の検証は材料にない。専用の llama.cpp fork が必要。