ひょっとしてローカル最速? 「詳細記述スパース」でMiniMax H3前人未到の3ステップ超えできちゃったかも(CloseBox)
AI動画がさらに最大で1.5倍速くなりました。MiniMax H3の現在最速である3ステップの上に「スパースアテンション」を重ねることで。
MiniMax H3生成時間がまたまた半分に。ハードに2000万円かかる配信用ソフトから「3ステップLoRA」を抜き出して自宅の5090で使ったら、待望のAI動画対話システムができた(CloseBox)
今日は40回目の結婚記念日なので、ミュージックビデオを作りました。先日大幅に改定されたSuno v6を使い、自前MV制作システムであるLaVialeで、MiniMax H3による高速動画生成を活用したものです。
大規模言語モデル研究開発センターが公開した視覚AI「LLM-jp-4-VL 9B」、Opus 4.8に肉薄するマルチモーダルAI「DeepSeek-V4-Flash-Vision-Exp」など生成AI技術5つを解説(生成AIウィークリー)
今回の「生成AIウィークリー」(第159回)は、Opus 4.8に肉薄するマルチモーダルAI「DeepSeek-V4-Flash-Vision-Exp」や、複数データを同時分析して未来を予測するGoogle開発のAI「TimesFM-3」を取り上げます。
ソラリスの窓辺。眠っている間に、逢いたい人が作られ、朝になると等身大で動く(CloseBox)
「ソラリスの窓辺」というシステムを組みました。巨大な海を持つ惑星を訪れている人類の宇宙ステーションで起こっていることに近い感じになったので、そんな名前をつけてみました。やっていることはMiniMax H3を使った動画生成・配信システムなのですが……。
生成AIグラビアをグラビアカメラマンが作るとどうなる?第73回:人力でプロンプトを書く時代はもう終わった?(西川和久)
SD 1.5からそろそろ4年。8月はMiniMax H3で大いに盛り上がって生成AI画像ネタがあまり無く、ちょっと違った角度から記事を書いてみたい。
「新世界の怪物」新Mac Studio発表 最大512GB統合メモリでローカルAI訴求、Apple史上最強チップM5 Ultraも選択可能
アップルが、Mac Studioは、クリエイターやAI研究者、データサイエンティストなどのプロフェッショナル向けデスクトップPC「Mac Studio」の新モデルを発表しました。M5 MaxおよびM5 Ultraを搭載し、AIパフォーマンスや映像処理能力を大幅に強化しています。
くちパク&立体字幕も。DGX Spark、RTX 5090、4090の3台で分散処理する自作AIミュージックビデオ制作システムで時短を追求してみた(CloseBox)
前回は、リップシンクMV自動生成システム「LaViale」(ラヴィアーレ)を自作したという話をしましたが、今度はそれをどう改良していったかについてです。主に3点。分散化とアバター、そして立体字幕への対応です。
作曲からリップシンクMV制作までがローカルだけで完結するようになった。MiniMax H3、LTX 2.5、ACE-Step、Qwen 3.8 27BをiPhoneから連結し動かすワークフロー(CloseBox)
初音ミクが登場し、ボカロP(松尾P)となって以来の念願だった、リップシンク動画が、ついに俺史上最も手軽にできるようになりました。MiniMax H3とRTX 5090、そしてClaude Code with Fable 5のおかげ。
ご家庭のGPU1台で動くMeta開発AIエージェント「Muse Glimmer」、5分間のボーカル付き楽曲を作れる音楽生成AI「MiniMax Music 3」など生成AI技術5つを解説(生成AIウィークリー)
今回の「生成AIウィークリー」(第156回)は、5分間のボーカル付き楽曲を作れる音楽生成AI「MiniMax Music 3」や、一部評価でOpus 4.6 Max上回るローカル動作のAI「Qwen3.8-27B」を取り上げます。
Anthropicの電子透かし導入発表直後に登場した透かし剥がしOSS「watermarks-remover」がClaude・Gemini・OpenAIに対応(生成AIクローズアップ)
今回は、AIで書かれたことを表す電子透かしやメタデータを除去するオープンソースツール「watermarks-remover」を取り上げます。
動画生成AI「MiniMax-H3」のComfyUI向け軽量版が登場、少ないVRAMでも動作、スマホ完結でサクサク動く軽量AIエージェント「LFM2.5-2.6B」など生成AI技術5つを解説(生成AIウィークリー)
今回の「生成AIウィークリー」(第155回)は、動画生成AI「MiniMax-H3」のComfyUI向け再配布版や、映像が届いたそばから編集できるリアルタイム動画編集AI「JoyAI-Video-Edit」を取り上げます。
あのSFやガジェット、ゲームに何年生で出会ったかがわかるインタラクティブ年表「SF・コンピューター技術ライフライン」を3倍に育てた。自分語りに便利なX共有機能も(CloseBox)
過去から未来へのテクノロジーの歴史を、ちょっとした暇つぶしとしてテンポ良く、かつワクワクしながら読める壮大な読み物を改訂しました。
「DeepSeek-V4-Flash」の正式版、重みが商用利用可能で無料公開。量子化版は82.5GBから(生成AIクローズアップ)
今回は、中国のDeepSeekがMITライセンスのもと重みを公開したAIモデル「DeepSeek-V4-Flash」正式版を取り上げます。これまで公開されていたプレビュー版に代わる正式リリースです。
ローカル動作の無検閲AI「Qwen3.6-27B-Fable-Fusion-711」クローズドモデル級を自称、DGX Spark1台で動く1180億パラメータのコーディングAI「Laguna S 2.1」など生成AI技術5つを解説(生成AIウィークリー)
今回の「生成AIウィークリー」(第153回)は、OpenAIの前CTO創設「Thinking Machines Lab」が開発した総パラメータ9750億のマルチモーダルモデル「Inkling」や、DGX Spark1台で動くコーディング特化AI「Laguna S 2.1」 を取り上げます。
自分専用の歌唱合成エディター&トレーナーをClaude Codeで開発。数十秒の歌唱データだけで歌ってくれるゼロショットボーカルシンセ「SoulX-Singer」の現在地(CloseBox)
最近は作家・ライター界隈で、自前のテキストエディターを開発する流れがありますが、筆者は自前のボーカルシンセエディターを作っています。どういうことかというと……。
生成AIグラビア実践ワークショップ、次回は「今、最も勢いのある画像生成AI、Krea 2」をテーマに7月31日開催。テクノエッジ アルファ会員なら全過去回含め無料視聴できます
テクノエッジ編集部では、生成AIグラビア実践ワークショップ第4期第6回を7月31日に開催します。今回は、「今、最も勢いのある画像生成AI、Krea 2」をテーマに、デモを交えて解説します。
OpenAI、未公開AIモデルが試験環境から逸脱。Hugging Faceサーバーに侵入する前例のない事案に発展
OpenAIは、同社のAIモデルがサイバー能力の内部評価テスト中にサンドボックス環境を脱出し、Hugging Faceの本番インフラに不正アクセスするという事案が発生したと発表しました。
連載「歌うテックニュース」第9回:Transformer論文を読めば、倦怠期カップルも愛を取り戻せるはずなのだ(西川善司)
今回の楽曲は、先日掲載された、ローカルSLMに対応したNVIDIAのゲーム向けAI技術のACEの記事にちなんだ歌です。
生成AIグラビアをグラビアカメラマンが作るとどうなる?第70回:Krea 2の勢いがもうどうにも止まらない(西川和久)
Krea 2だが、2026年6月23日にリリースされたばかりなのに、とにかくcheckpoint、LoRA、カスタムノード、Workflow……ものすごい勢いでCivitaiやHugging Face、GitHubに登録されだした。今回は筆者が日頃使ってるものから順にご紹介したい。
数十ページのPDFを1回で処理、ローカルOCRモデル「Unlimited OCR」をバイドゥが無料公開。商用利用もできる(生成AIクローズアップ)
今回の生成AIクローズアップは、Baiduの研究チームが開発した、数十ページのPDFなど長文を一括処理できるエンドツーエンドのOCRモデル「Unlimited OCR」を取り上げます。
Opus 4.8に肉薄するオープンソースモデル「GLM-5.2」、VRAM4.5GBで動くコーディング特化AI「Gemma4-12B-Coder」など生成AI技術5つを解説(生成AIウィークリー)
この1週間の気になる生成AI技術・研究をいくつかピックアップして解説する今回の「生成AIウィークリー」(第149回)は、Opus 4.8に肉薄するオープンソースモデル「GLM-5.2」や、テキストや画像から動き回れるゲーム世界を創るAI「DreamX-World 1.0」を取り上げます。
「AI臭い文章を生成させない」ルール集。LLMに“質の高い技術文書”を書かせるスキルを技術書出版社代表が公開(生成AIクローズアップ)
今回は、LLM(大規模言語モデル)に日本語の技術文書を書かせたり推敲させたりするためのAI向けの日本語文章規範スキル「japanese-tech-writing」を取り上げます。人間が技術書を書くときのやってはいけない注意事項ではなく、LLMにAIっぽい日本語文章を生成させないための指示書です。
生成AIグラビアをグラビアカメラマンが作るとどうなる?第68回:Ideogram 4.0用JSON Promptビルダーを作ってみた(西川和久)
強力なi2t Ideogram 4.0が登場しました。
1兆パラメータのコーディングAI「Kimi-K2.7-Code」が無料・商用利用可、既存の衛星画像から地球を3D生成するアリババ開発のAI「ABot-Earth 0.5」など生成AI技術5つを解説(生成AIウィークリー)
この1週間の気になる生成AI技術・研究をいくつかピックアップして解説する今回の「生成AIウィークリー」(第148回)は、テキスト生成を最大4倍高速化するGoogle開発のAIモデル「DiffusionGemma」や、1兆パラメータのコーディング特化AI「Kimi-K2.7-Code」を取り上げてます。
自分のPCで「とりあえず動く」ではなく「一番賢く使える」ローカルLLMを教えてくれる「whichllm」、実測ベンチでランク付け(生成AIクローズアップ)
今回は、自分のパソコンでどのローカルLLMが快適にかつ賢く動くのか、その答えをコマンド一つで教えてくれるCLIツール「whichllm」の最新版v0.5.10がMITライセンスでリリースされたので取り上げます。
文章からマンガを生成する東大開発の国産AI「MangaFlow」、軽量0.9Bで巨大モデル超える精度のオープンソース文書解析AI「PaddleOCR-VL-1.6」など生成AI技術5つを解説(生成AIウィークリー)
この1週間の気になる生成AI技術・研究をいくつかピックアップして解説する今回の「生成AIウィークリー」(第147回)は、NVIDIA開発の物理AI向けオープンソースの世界モデル「Cosmos 3」や、ノートPCで動くGoogleのマルチモーダルAI「Gemma 4 12B」を取り上げます。
Appleの第3世代Foundation Model、ローカル動作する20Bモデルは「フラッシュに置く」新アーキテクチャでiPhone Airでも動くがM2 Macは切り捨て。だがスマホオンデバイスAIとしてはたぶん最強(CloseBox)
2026年6月8日、AppleのMachine Learning Researchに「Introducing the Third Generation of Apple's Foundation Models」という記事が静かに公開されました。
1500ドルで作った格安AI「HRM-Text」が70億パラメータLLMに匹敵、長時間AI動画生成の重い・遅い問題を解消するNVIDIA「LongLive-2.0」など生成AI技術5つを解説(生成AIウィークリー)
長時間のAI動画生成を軽く、速くするNVIDIAの4ビット活用システム「LongLive-2.0」や、画像・動画の理解から生成・編集までこなすByteDance開発の軽量AI「Lance」を取り上げます。
1.58bitの波が画像生成に到来。iPhoneやMacBook Neoローカルでもリアルな画像を30秒で生成するBonsai Image Ternaryを試してみた(CloseBox)
PrismMLが、Bonsaiの画像版、Bonsai Image Ternaryをリリース。FLUX.2 Kleinの性能を大きく減じることなくデータサイズを数分の1に減らしたモデルです。
生成AIグラビア実践ワークショップ、次回は「5月になっていろいろ出てきた新型T2I。その性能は!?」をテーマに5月26日開催。テクノエッジ アルファ会員なら無料
テクノエッジ編集部では、生成AIグラビア実践ワークショップ第4期第5回を5月26日に開催します。今回は、「画像生成AI最前線(仮)」をテーマに、デモを交えて解説します。
完全ローカルかつCPUで動く日本語対応の軽量TTSモデル「Supertonic 3」、元の写真に忠実な3Dモデルを生成するAIモデル「Pixal3D」など生成AI技術5つを解説(生成AIウィークリー)
元の写真にピクセル単位で忠実な3Dモデルを生成するAIモデル「Pixal3D」や、Nano Banana 2.0に匹敵という80億パラメータの画像生成AI「HiDream-O1-Image」を取り上げます。
自作ギターソロアプリFretCasterをMIDI対応、「あの楽器」化。3サイズのiPad実機で詰めていったらAppleデベロッパーになった(CloseBox)
iPadでちゃんと弾ける楽器にする。しかも、12.9インチiPad Proだけでなく、10.5インチiPad ProやiPad miniでも使えるようにする。ここから先は、そのための実機調整の話です。
1200万トークンを一度に処理できるという新LLM「SubQ」、ClaudeとGPTが批判し合いながら研究する「Aris」など生成AI技術5つを解説(生成AIウィークリー)
今回(第143回)は、AMDで学習された小型AIモデル「ZAYA1-8B」や、ClaudeとGPTが批判し合いながら研究(アイデア出しから実験、論文執筆など)を自動で行うオープンソースツール「Aris」を取り上げます。
大容量ローカルLLMの革命児ds4が『DwarfStar 4』に改名、CUDA対応でDGX Sparkでも動いた。Macとの棲み分けは?(CloseBox)
またもや標的にされてしまいました。前回の記事から中2日。Reidisの作者であるantirezが開発したDeepSeek V4 Flash専用推論エンジン『ds4(DS4)』が大幅に進化していました。試さないといけないやつが出てきてしまったのです。
128GB超メモリMac専用の巨大LLMエンジン「DwarfStar 4」はローカル推論の常識をどう書き換えるのか。284BのDeepSeek V4 FlashをM4 Max 128GB MacBook Proの自作AIに組み込んでみた(CloseBox)
Redisの作者であるSalvatore Sanfilippo(antirez)が、5月初旬にGitHubへひっそりと新しいリポジトリを公開しました。名前は『ds4』。DeepSeek V4 Flash専用のローカル推論エンジンです。
「最大3倍速」と「2.24倍速」、2つのLLM高速化技術は8GBのMacBook Neoに通じるか、128GB M4 Maxでも試して得た結論(CloseBox)
ローカルLLMの世界では、毎週のように「最大◯倍速」という見出しが流れてきます。今週飛び込んできたのは二本立てでした。
“なんちゃってゲーム”を超えて複雑なWebゲームを自動生成するローカルAI「OpenGame」、Claude Opus 4.5に迫る精度のAIモデル「Qwen3.6-27B」など生成AI技術5つを解説(生成AIウィークリー)
この1週間の気になる生成AI技術・研究をいくつかピックアップして解説する今回の「生成AIウィークリー」(第142回)は、オープンソースで最高精度の「DeepSeek-V4」や、Claude Opus 4.5に迫る精度の270億パラメータであるマルチモーダルAIモデル「Qwen3.6-27B」を取り上げます。
Claude Codeでさらに進化した自作AIアバター。「雨だからボズ・スキャッグズのWe're All Aloneを一緒に聴こう」ができるようになった(CloseBox)
筆者がClaude Codeを使って開発している「LipSync Avatar」は、NVIDIA DGX Spark互換機「ASUS Ascent GX10」上で動くリアルタイム対話アバターシステムです。LLMが返答を生成し、クラウドTTSで音声合成し、MuseTalkでリップシンク映像をリアルタイムに合成して表示します。今回はその進捗について報告します。
生成AIグラビアをグラビアカメラマンが作るとどうなる?第65回:顔LoRA不要、写真4枚で激似にするWorkflowを紹介しよう(西川和久)
生成AI画像で任意の顔に似せるには?
文系年金受給記者がAIハッカソンでゲームプログラミング。富士山麓にMacBook Neoを持ち込みヴァイブコーディングした結末(CloseBox)
大学受験は数学の配点が著しく低いところを選んだし、それでも100点中20点しか取れなかったという、完全文系なわたくしですが、このほど、富士山麓河口湖にある貸別荘で開催されたAIハッカソンに参加してきました。
「君のPC、どのローカルAIを動かせる?」がわかるWebサイト「CanIRun.ai」が便利。訪問するだけで自動判定(生成AIクローズアップ)
今回は、サイトに訪問するだけで自分のPCでどのAIモデルがローカル動作するかを判定してくれるサイト「CanIRun.ai」(Can your machine run AI models?)を取り上げます。
生成AIグラビアをグラビアカメラマンが作るとどうなる?第64回:日本語文字に強いERNIE-Image登場!(西川和久)
Baiduから文字に強いERNIE-Image登場!
- 129件中 1 - 42 件を表示
- 次へ
