Qwen3.8-27Bの精度98%を維持しつつ9倍小型化しiPhoneでも動く「Bonsai-2-27B」など生成AI技術5つを解説(生成AIウィークリー)

テクノロジー AI
山下(Seamless)

2014年から幅広い分野の研究論文をピックアップして解説しているメディア「Seamless」(シームレス)を個人運営しています。

特集

この1週間の気になる生成AI技術・研究をいくつかピックアップして解説する今回の「生成AIウィークリー」(第161回)は、高度な画像編集ができるオープンウェイトな画像生成AI「Qwen-Image-2.1」や、XiaomiのオープンソースAIモデル「MiMo-V2.6」を取り上げます。

また、Black Forest Labsが公開したロボットを動かすAIモデル「FLUX 3 Action」と、Qwen3.8-27Bを9分の1に圧縮するも性能98.2%を維持するAIモデル「Bonsai-2-27B」をご紹介します。

そして、生成AIウィークリーの中でも特に興味深いAI技術や研究にスポットライトを当てる「生成AIクローズアップ」では、文章を生成せず判断だけする、オープンソースの意思決定AIモデル「Laya」を別の単体記事で取り上げています。

高度な画像編集ができる画像生成AI「Qwen-Image-2.1」がオープンウェイトで登場。背景透過PNGにも対応

Alibaba Qwenチームは、テキストからの画像生成と画像編集を統合した70億パラメータ(画像生成部分)のオープンウェイトモデル「Qwen-Image-2.1」を公開しました。Nano Banana 2.0を超える精度だといいます。

このモデルは編集精度が高く、背景なしの透過画像を直接作れます。それだけでなく最大10枚の画像を同時に読み込めるため、服や靴、カバンなどの画像を組み合わせて自然な試着画像を作ったり、複数の家具を配置した部屋の画像を合成したりできます。

編集したい場所をマスクで指定して書き換える編集や、パノラマ画像や絵コンテの作成といった幅広い用途にも対応しています。

生成AIグラビアをグラビアカメラマンが作るとどうなる?第75回:Qwen-Image 2.1は商用利用に制限あり、Ming ImageはUI/UX特化だがリアル人物OKで自由度高くて期待大(西川和久)

Qwen-Image-2.1
Qwen team
GitHub | Blog | Hugging Face

Xiaomi、オープンソースAI「MiMo-V2.6」公開。オープンソースの中で最高性能をうたう

Xiaomiがテキスト・画像・動画を扱えるオープンソースのAIモデル「MiMo-V2.6」シリーズをリリースしました。効率とコストのバランスが良い「Flash」、性能の高い「Pro」のモデルが用意されています。

テキストや画像から3Dオブジェクトを生成しゲームのインタラクティブな世界を構築するだけでなく、ロボットアームを視覚情報に基づいて制御するシミュレーションにも対応します。また、フロントエンドUIやプレゼンテーション資料の高度なデザイン、映像制作から作曲に至るまで、多岐にわたるクリエイティブタスクを処理することが可能です。

科学研究の分野でも活用されており、研究者と協働してAIが文献を検索して新素材の候補を見つけたり、数学の定理を形式化したりといった成果も出ています。

評価において、Proは、Artificial Analysisの指標でKimi K3やQwen3.8 Maxを上回るスコアを記録し、オープンソースの中で最高性能を達成しました。

Xiaomi MiMo-V2.6
Xiaomi
Paper | Blog | Hugging Face

ロボットを動かすAIモデル「FLUX 3 Action」をBlack Forest Labsが公開。従来の半分以下のサイズで最高性能

Black Forest Labsは、ロボットなどのAIエージェント向けに、70億パラメータのオープンモデル「FLUX 3 Action」を発表しました。

このモデルは、カメラの映像などのデータをもとに、次に取るべき行動と、その結果として周囲の環境がどう変化するかを同時に予測します。

FLUX 3 Actionは、従来の最高性能オープンモデル(Cosmos 3 Nano、16B)と比較してサイズを半分以下に抑えつつ、RoboLab-120ベンチマークで過去最高の成功率を達成。さらに、処理速度も最大で3.95倍に引き上げており、リアルタイム性を向上させています。

また、GPT 6 Astraのような推論モデルと組み合わせたハイブリッド手法も可能で、高い成功率を維持しつつ、コストと時間を軽減しています。

FLUX 3 Action
Black Forest Labs
Blog | Hugging Face

Qwen3.8-27Bを9分の1に圧縮するも精度98.2%を維持、iPhoneでも動くAIモデル「Bonsai-2-27B」 

Prism MLより、高い圧縮率と性能を両立した270億パラメータのマルチモーダルAIモデル「Bonsai-2-27B」がApache 2.0ライセンスで公開されました。

このモデルは「Qwen3.8 27B」をベースにしており、重みを3値(-1, 0, +1)で表現する圧縮技術を採用することで、フル精度モデルから9倍以上縮小した5.9GBのメモリサイズを実現しています。

軽量化を図りながらも、ベースモデルのトータルベンチマーク性能の98.2%を維持、圧縮前とほぼ同等の高い精度を発揮できるとしています。

動作環境について、本モデルはNVIDIA GPU(CUDA経由)や、Mac、iPhone、iPadなどのAppleデバイス(MLX経由)上でも動作可能です。

Ternary-Bonsai-2-27B-gguf
Qwen3.8-27B
Paper | Blog | Hugging Face


《山下(Seamless)》

Amazon売れ筋ランキング

山下(Seamless)

2014年から幅広い分野の研究論文をピックアップして解説しているメディア「Seamless」(シームレス)を個人運営しています。

特集

BECOME A MEMBER

『テクノエッジ アルファ』会員募集中

最新テック・ガジェット情報コミュニティ『テクノエッジ アルファ』を開設しました。会員専用Discrodサーバ参加権やイベント招待、会員限定コンテンツなど特典多数です。