
ノートPCで強力なQwen 3.8 27B、デフォルトの理性が137秒を21分に
Simon Willisonは、AlibabaのApache 2ライセンスモデル「Qwen 3.8 27B」を17GBのQ4_K_Mビルドとして、128GB M5 Max MacBook ProおよびNVIDIA DGX Spark上のLM Studioで実行した。同氏は、毎秒15〜30トークンでのコーディングエージェントとしての動作、バウンディングボックスの精度、画像アノテーションを高く評価している。しかし、デフォルトで設定されている「xhigh」の理性が落とし穴となっている。ペリカンのSVGでは、理性をオフにすれば137秒で済むところ、21分かけて22,276の理性トークンを消費した。同モデルをローカルで実行する場合、理性を低くするかオフにした状態で開始し、コンテキストをLM Studioのデフォルトである8,192トークン以上に引き上げる必要がある。17GBのローカルモデルがホスト型APIを代替する上で残された障壁は、出力品質ではなくスピードである。
出典: simonwillison.net ↗
3,223のtokensの出力を生成するのに、22,276のreasoning tokensを使い、21分かかった。
Simon Willison
なぜ重要か
- → デフォルトの推論設定により、27Bモデルがローカルハードウェア上で10倍遅くなる
- → 強力なコーディングおよびビジョンタスクは、消費者向け展開におけるパフォーマンス上の落とし穴を隠している
- → コンテキストの制限は、過剰な思考を主要なUX障壁として露呈させ、出力品質の向上ではない
速度が推論を殺す