「MiMo-V2.6」という名前を、AI関連のニュースやSNSで見かけた人も多いはずです。中国のXiaomi(シャオミ)のAI開発チームが2026年9月22日に公開したAIモデルで、誰でもダウンロードできる形で配られました。
公開モデルの中では、第三者の総合評価で1位になっています。何なのか、自分に関係あるのかを、専門用語をできるだけ使わずに説明します。
ひとことで言うと何?
MiMo-V2.6は、文章・画像・動画・音声を読み取って、長い作業を自分で進めるためのAIモデルです。しかも中身(モデルの重み)が公開されていて、誰でも無償で入手できます。
たとえるなら、人気レストランが看板料理の「レシピ」を丸ごと公開したようなものです。お店で食べるだけでなく、自分の台所で作ったり、味を変えたりできます。AIでいえば、XiaomiのAPI(ネット越しに呼び出す窓口)で使うこともできますし、モデル本体を自分のコンピューターに置いて動かすこともできます。
これまでと何が変わるのかを3点にまとめます。
- 公開されているAIモデルの中で、総合評価の点数が最も高くなった
- 同じくらいの点数のAIと比べて、1つの作業にかかる費用がかなり安い
- 学習の様子を途中から公開し、学習に使った環境やコードまで配った
MiMo-V2.6とは?誰が作った何なのか
MiMo-V2.6は、XiaomiのAI開発チーム「Xiaomi MiMo」が作った大規模言語モデル(※文章を読んで書くAIの本体)のシリーズです。PC Watchの記事によると、公開されたのは次の3つです。
| モデル | 大きさ(総パラメータ数) | 位置づけ |
|---|---|---|
| MiMo-V2.6-Pro | 1.02兆 | 最上位版 |
| MiMo-V2.6-Flash | 3,100億 | 軽くて安い版 |
| MiMo-V2.6-Distill-Qwen-9B | 90億 | 研究者が試すための小型版 |
パラメータ数は、AIの「脳の細胞の数」のようなものです。
ChatGPTとの一番の違いは、中身が公開されているかどうかです。ChatGPTは運営会社の中にあり、外からはサービスとして使うだけです。MiMo-V2.6はMITライセンス(※商用利用・改変・再配布を認める緩い利用条件)で配られていて、Hugging Faceから無償でダウンロードできるとされています。
もう1つの違いは、扱える情報の種類です。Artificial Analysisによると、Proは文字・画像・音声・動画を入力として受け取れます。ただし出力は文字だけです。「オムニモーダル」(何でも読める)といっても、画像や音声を作るAIではない点に注意してください。
なぜ話題になっているのか
理由は大きく3つあります。
1つ目は、評価の高さです。AIの性能を横並びで比べている第三者機関Artificial Analysisの総合指標で、Proは46点を取りました。これは同じ規模の公開モデル114個の中で1位です。
ただし、AI全体の1位ではありません。XenoSpectrumの記事によると、中身を公開していないAIも含めると、Claude Opus 5(最大設定)が51点、GPT-5.6 Sol(最大設定)が47点で上にいます。
2つ目は、安さです。同じ記事によると、評価の1問あたりにかかった費用は、Proが0.13ドル、Claude Opus 5が5.86ドルでした。Claude Opus 5のおよそ45分の1です。
3つ目は、学習を「公開の場」で行ったことです。Forkastの記事によると、Xiaomiは学習の途中経過を、費用や成績とともにライブで公開しました。米国の大手AI企業には見られない公開ぶりです。
何ができるのか・どうやって賢くしたのか
長い作業を自分で進められる
MiMo-V2.6が特に伸ばしたのは、AIエージェント(※人の指示を受けて、道具を使いながら作業を自分で進めるAI)としての力です。公式発表では、パソコンの画面を見てアプリを操作し、調べもの・編集・データ処理をこなせると説明しています。結果を画面で確かめ、次の手を直すところまで含みます。
公式発表とProの製品ページでは、次のような使い方を紹介しています。
- 画像や文章から、実際に遊べる3Dゲームの世界を組み立てる
- 3D制作ソフトのBlenderで、説明文や参考画像から立体模型を作る
- シミュレーション上のロボットアームを、カメラ映像を見ながら動かす
- Xiaomiの材料研究者と組んで、汚染物質を吸着する新素材の候補を絞り込む
自社の評価でも、得意と不得意がある
Xiaomiが出した比較表を見ると、何でも勝っているわけではありません。PC Watchによると、業務の自動化を測る「AutomationBench」では、Proが53.1点でClaude Opus 5の50.3点を上回りました。
一方、長時間のプログラム修正を測る「DeepSWE v1.1」では、Proの71.9点に対しClaude Opus 5が74.0点です。XenoSpectrumは、万能になったというより「道具を使って長く作業するAI」として伸びたモデルだと見ています。
賢くした方法は「大量の試行錯誤」
MiMo-V2.6の学習の中心は、強化学習(※課題を解かせて採点し、その結果でAIを直していく学び方)です。ドリルを解いて答え合わせをし、間違えたところを直す勉強に近いやり方です。
公式発表によると、ProとFlashはそれぞれ6日足らずで約75万回分の作業記録を積みました。XenoSpectrumによると、1回分の作業記録は平均11万〜15万トークン(※AIが文章を数える単位)に達します。コードを読み、書き換えて試し、失敗を見て直す流れを、1回分として丸ごと練習させたわけです。
費用も公開されました。公式発表によると、この学習にかかったのはFlashで約85万ドル、Proで約262万ドルです。
AIの研究者Sebastian Raschka氏は自身のブログで、Proの内部は「シンプルな設計」で、伸びの多くは学習のやり方の工夫から来ていると見ています。
自分に関係ある?向いている人・向いていない人
結論から言うと、多くの人にとっては「直接使うもの」ではなく「サービスの裏側に組み込まれるもの」です。ChatGPTのように、アプリを開いてすぐ話しかける使い方を想定した資料は見当たりませんでした。
向いているのは、次のような人や会社です。
- 自社サービスにAIを組み込みたいが、費用を抑えたい開発チーム
- データを外に出さずに、自分の設備でAIを動かしたい組織
- AIエージェントやAIの学習方法を研究している人
- Claude CodeやClineなどの開発ツールで、別のモデルを試したいエンジニア
向いていないのは、次のような人です。
- プログラミングをせずに、今すぐチャットでAIを使いたい人
- 画像や音声を「作りたい」人(出力は文字だけ)
使い方・始め方(触ってみたい人向け)
ここからは実際に触ってみたい人向けです。読み飛ばしても全体像は分かります。
一番手軽なのは、XiaomiのAPIを使う方法です。Proの製品ページによると、手順は次の3段階です。
- 管理画面で残高をチャージする(使った分だけ払う前払い方式)
- アカウントを作り、APIキー(※利用者を見分ける合言葉)を発行する
- OpenAIまたはAnthropicと同じ形式で呼び出す
既存のコードの接続先(base_url)とモデル名を差し替えるだけで済むとされています。Pythonの例は次のとおりです。
import os
from openai import OpenAI
client = OpenAI(
api_key=os.environ.get("MIMO_API_KEY"),
base_url="https://api.xiaomimimo.com/v1",
)
completion = client.chat.completions.create(
model="mimo-v2.6-pro",
messages=[{"role": "user", "content": "please introduce yourself"}],
max_completion_tokens=1024,
)
print(completion.model_dump_json())
軽い版を使う場合は、モデル名を mimo-v2.6-flash にします。料金は次のとおりです(100万トークンあたり、ProとFlashの製品ページより)。
| モデル | 入力 | 出力 |
|---|---|---|
| MiMo-V2.6-Pro | 0.435ドル | 0.87ドル |
| MiMo-V2.6-Flash | 0.14ドル | 0.28ドル |
Flashの料金はProのおよそ3分の1です。一度に読める量はどちらも100万トークンで、Artificial AnalysisはA4用紙およそ1,500ページ分と説明しています。
使う量が多い人向けに月額・年額の「Token Plan」もあり、Claude CodeやClineにそのままつなげるとされています。
注意点・現時点で分かっていないこと
まず、点数は「ある時点の、ある評価方法での結果」です。XenoSpectrumも、評価の内容や推論の設定が変われば数字は動くと注意しています。「最強のAI」ではなく「2026年9月23日時点で最高点の公開モデル」と受け取るのが正確です。
次に、返事の速さです。Artificial Analysisによると、Proの出力は毎秒約55トークンで、比較対象の平均(毎秒67トークン)より遅めです。学習の公開ぶりにも、疑問の声があります。Forkastによると、Hacker Newsでは、ページを読み込み直すと公開ダッシュボードの数字が巻き戻るという指摘がありました。ダッシュボードに「Claude Distill Requests: hidden」という項目があったことから、他社のAIの出力を学習に使っているのでは、という見方も紹介しています。
資料の数字にも食い違いがあります。
- ProのDeepSWE v1.1は、公式発表では72.6点、Xiaomiの比較表(PC Watch・XenoSpectrum掲載)では71.9点
- 1回の学習更新で扱うトークン数は、公式発表が35億〜37億、Raschka氏のブログが27億〜37億
- 非公開の最強AIとして、公式発表は「Claude Fable 5.1」「GPT-6 Astra」を挙げ、XenoSpectrumはClaude Opus 5とGPT-5.6 Solを比べている
最後に、自分のパソコンで動かすのに必要な機材や、日本語での実力は、今回の資料からは確認できませんでした。Proは総パラメータが1兆を超えるので、手元で試すなら9Bの小型版が現実的だとPC Watchは紹介しています。
まとめ
- MiMo-V2.6は、Xiaomiが作った「文章・画像・動画・音声を読めるAI」で、中身が無償で公開されている
- 公開されているAIの中で、第三者の総合評価が最も高い。ただし非公開の最上位AIには届いていない
- 同じくらいの点数のAIと比べて、1つの作業にかかる費用がかなり安い
- 多くの人にとっては、アプリで使うものではなく、サービスの裏側に組み込まれるもの
- 学習の公開ぶりには疑問の声もあり、数字は今後も動く
よくある質問
MiMo-V2.6は無料で使えますか?
モデル本体はMITライセンスでHugging Faceから無償でダウンロードできます。ただし自分で動かすには大きなコンピューターが要ります。XiaomiのAPIで使う場合は、使った量に応じた料金がかかり、Proは100万トークンあたり入力0.435ドル・出力0.87ドルです。
プログラミングができなくても使えますか?
今回の資料では、ChatGPTのようにアプリを開いてすぐ話しかける使い方は確認できませんでした。APIやモデル本体を使う方法が中心なので、主に開発者が自社のサービスや開発ツールに組み込んで使うものです。
ProとFlashはどう違いますか?
Proは総パラメータ1.02兆の最上位版で、Flashは3,100億の軽い版です。Xiaomiの比較表ではFlashもProに近い点数を出しており、APIの料金はFlashがProのおよそ3分の1です。どちらも一度に100万トークンまで読めます。
ChatGPTやClaudeより賢いのですか?
総合評価では、公開されているAIの中で1位ですが、非公開のAIも含めるとClaude Opus 5やGPT-5.6 Solが上です。業務の自動化を測る評価ではClaude Opus 5を上回った項目もあり、得意と不得意が分かれています。


