【生成AIニュースメモ】MiniMax、マルチモーダル生成モデル「H3」を発表(2026/8/1)
2026年8月1日
MiniMaxは2026年7月31日、汎用マルチモーダル生成モデル「MiniMax H3」を発表しました。テキスト・画像・動画・音声にまたがる文脈を統一的に理解し、ネイティブステレオ音声付きの動画を最大15秒・2K解像度で生成します。2Kでの秒単価は主要モデルの3分の1未満という価格性能を掲げるほか、オープンソースコミュニティの支援などのため、法令の範囲でモデルの重みを数日中に公開する計画も明らかにしました。
【生成AIニュースメモ】リコー、GENIAC第3期で推論性能を備えたマルチモーダルLLMを開発(2026/3/30)
2026年3月30日
リコーは2026年3月30日、経済産業省とNEDOが実施する生成AI開発力強化プロジェクト「GENIAC」第3期において、図表を含む多様なドキュメントを高精度に読み取れる、リーズニング性能を備えたマルチモーダル大規模言語モデルの基本モデル「Qwen3-VL-Ricoh-32B-20260227」の開発完了を発表しました。多段推論を通じて複雑なドキュメントを理解できる点が特徴です。あわせて、同モデルの開発で適用した技術を活用した軽量モデル「Qwen3-VL-Ricoh-8B-20260227」を同日から無償公開し、リーズニング評価に特化した独自ベンチマークツールも今後公開する予定です。
LLaVA-1.5 で画像からテキストに変換する
2023年10月14日
今回の記事では画像からテキストに変換できるLLaVA-1.5の実装を紹介します。 Google Colabを使用して簡単に実装できますので、ぜひ最後までご覧ください。 LLaVA-1.5とは LLaVA 1.5は、視覚言 […]

