
AlibabaのQwen-Image-3.0、図解グリッドと10ピクセルのテキストをワンパス生成
AlibabaのQwenチームは「Qwen-Image-3.0」をリリースした。同モデルは4,500トークンのプロンプトを受け付け、日本語を含む12言語で、判読可能な10ピクセルのテキスト、LaTeXの数式、9分割のインフォグラフィックグリッドをワンパスで生成する。これにより、新聞の紙面、試験問題、注釈付きの識別プレートといったドキュメントのレイアウトを画像モデル内で完結できるようになるが、実稼働環境では依然として編集可能なフォーマットに軍配が上がる。今回のリリース形態がその意図を物語っており、招待制APIのみの提供で、技術レポートやオープンウェイトの公開もなく、初代Qwen-Imageとは正反対の方針をとっている。
出典: the-decoder.com ↗
このモデルは、魅力的な画像を生成するだけでなく、新聞のレイアウト、絵コンテ、試験用紙のような実用的な作業を処理することを意図している。
Alibaba Qwenチーム
なぜ重要か
- → レイアウトとタイポグラフィのレンダリングを単一の画像生成パスに統合する
- → 以前は外部ツールが必要だった新聞、インフォグラフィックス、試験用紙のような密な情報デザインを処理できる
- → 重みの非公開化と招待制APIは、オープンな研究から独自の製品への移行を示す
ワンパスでレイアウト