llama.cpp v0.4.0公開 — 新モデルへの対応とメモリ使用量の最適化を実現
ア
llama.cpp v0.4.0公開 — 新モデルへの対応とメモリ使用量の最適化を実現 https://bunrin.work/news/ja/releases/llama-cpp-v0-4-0-96801 llama.cppは、Qwen3.8-Flash-Nextの初期サポートや、メモリロード時のピーク回避機能を含むv0.4.0をリリースしました。