ミラ・ムラティのインクリングAIモデルレビュー:西洋で最高のオープンソースモデル

By: rootdata|2026/07/26 14:01:03

ミラ・ムラティは、OpenAIを離れた後の2年間で新しいものを構築し、先週ついにそれを公に発表しました。

インクリングは、ムラティのThinking Machines Labからの最初のモデルであり、西洋のラボによってゼロから訓練された最高のオープンソースモデルでもあります。

西洋のラボはオープンソース競争で遅れをとっています---ミストラルの4月のリリースは、アリババのQwen、Z.aiのGLM、ムーンショットAIのKimiに支配されたリーダーボードに対抗しました。リーダーボード上の唯一の西洋モデルであるNvidiaのNemotronは、「最先端」と見なされるには程遠いです。インクリングは地域的な制約なしで、Apache 2.0の下でHugging Faceに完全な重みを持って登場します。

アーキテクチャはエキスパートの混合モデルです:合計9750億のパラメータ、推論時に41億がアクティブです。テキスト、画像、音声を読み取り、100万トークンのコンテキストウィンドウをサポートし、45兆トークンで事前訓練されています。(パラメータはモデルが処理できるすべてのダイヤルであり、トークンはAIが処理できる情報の基本単位を表します。)

結論としては:あなたはこれをローカルで実行していません---近くにもありません。

最も明確な利点は、エージェントツールの使用です。MCP Atlas---これは、エージェントがModel Context Protocol標準を通じて現実のタスクをどれだけ信頼性高く完了するかを測定し、完了したタスクの割合としてスコアを付けます---はインクリングに74.1%を与え、NvidiaのNemotron 3 Ultraよりもほぼ30ポイント高いです。SWE-Bench Verifiedでは、自律的なGitHubバグ修正のテストが問題解決の割合としてスコアを付け、77.6%を記録しました---Nemotronの70.7%を上回っています。 出典:Thinking Machines

これはOpenRouterで、1百万入力トークンあたり1ドル、1百万出力トークンあたり4.05ドルです。OpenRouterを通じてルーティングするHermesまたはOpenClawのセットアップは、追加の構成なしでこれを入れ替えることができます---そのMCP Atlasスコアはエージェントワークフローにとって堅実な選択肢となります。

ドルあたりの生のコーディングパフォーマンスでは、中国のモデルが依然として優位です。

モデルのテスト

ベンチマークは一つのことですが、実際にモデルを使ってみるのは別のことです。私たちは、平均的なユーザーがこれを使用する場合にどのように反応するかを確認するために、インクリングをさまざまなタスクで実行しました。ここが強みですが、同時に失望する点でもあります。

注目すべき良い点は、Thinking Machineの独自のインターフェースを介しても、モデルが完全にプライベートであると主張していることです。これは非常に重要です。

コーディング

これはほとんどの人が実際に気にすることなので、ここから始めましょう。複雑なプロンプトでは、インクリングは失敗する傾向があります---私たちの最も要求の厳しいテストでは、実行可能なものは何も生成されませんでした。複雑さを下げると、異なる結果が現れますが、必ずしも好意的なものではありません。

私たちは、ゾンビをキーストロークで撃つシューティングゲームを作成するために、長く詳細なプロンプトを使用しました。最初のプロンプトは1955語で、インクリングは空白の画面を作成しました。

プロンプトをはるかにシンプル(99語)に修正すると、モデルは独自のアプローチを選び、動作するゲームを出荷しました。「動作する」というのは、かなりの重みを持っています。

モンスターは長方形と球体として現れました。背景はなく、可視のプレイ画面もなく---敵のために抽象的な幾何学が埋め込まれているだけです。タイピングロジックは保持されました:キーストロークは正しく登録され、文字はゲームの設定に一致し、入力トラッキングは常にクリーンでした。

予想外だったのは動きです。ほとんどのモデルがデフォルトで静的な敵配置を持つのに対し、インクリングのクリーチャーは常にプレイヤーに近づいて進み続けました。これは、AI生成ゲームから通常得られるものよりも優れた設計上の決定です。

敵の出現は波のように到来するはずでした。しかし、実際には連続的な流れとして実行され、意図されたペースを損なう一方で、異なる種類のプレッシャーを生み出しました。

比較のために、私たちがBonsai 27Bを通じて同じプロンプトを実行したところ---これはQwen3.6に基づく圧縮モデルで、3.9 GBに収まり、電話で動作します---結果は全体的に明らかに良く、満足のいくものでした。

iPhoneで動作する27億パラメータのモデルは、データセンターが必要な9750億パラメータのモデルよりも、より完全なコーディング結果を生成しました。この単一のテストはInklingの全体的な能力について何も決定しませんが、9750億のパラメータが実際にどこに行っているのかという疑問を提起します。

Inklingによって作成されたゲームは、ここでテスト可能です。

Bonsai 27Bによって作成されたゲームは、ここで利用可能です。

異なるLLMによって生成された同じゲームの他のバージョンは、私たちのItch.ioサイトで確認できます。

連想的創造性

私たちの連想的創造性テストは、モデルが一見無関係な概念間に論理的な橋をどれだけうまく構築できるかを測定します---この場合、枝、プロレタリアートの搾取、そしてレタスです。

Inklingはこのセッションでの最良の作品から始まります: "樹皮としたがって伝記を剥奪された枝"は、歴史的アイデンティティを剥奪された労働者にきれいにマッピングされ、"風---見えないマネージャー---は動きが利益になると決定する"はその地位を得ます。着地はクリーンです: "あなたは人が壊れるのを見るのではなく、枝が落ちるのを見る。そしてその落下は'効率'と呼ばれる。"

文化的従属のセクションは、自己説明的な方法で関連性を確立します。"億万長者は枝の墓地のセコイアであり、私たちは彼の影を'インスピレーション'と呼ぶように教えられています"は成功しますが、その後のカタログ---雑誌での葉の磨き、富の粒を暗記し、全体を功績と呼ぶ---は、モデルが比喩を実行しているのではなく、拡張しているのです。論理はまだ存在しますが、実際には正確ではありません。

このテストは新しいため、Fable 5やGPT 5.6 Sol以外に比較できるモデルは本当にありませんが、Inklingをそれらと比較するのは不公平です。しかし、気になる方のために言えば、それは本当に同じリーグにはありません。

次にレタス---そして全体が崩れます。モデルはリアルタイムで自らの切断を発表します: "レタスは枝を覚えていない。レタスはそれを必要としない"は解決として書かれていますが、譲歩として読まれます。

この最後の部分では、モデルは無関係なアイデア間の接続を確立する方法を本当に知らなかったため、単にそれについて話しましたが、実際には構造的に意味のあることを言っていません。

完全なプロンプトと出力は、私たちのGithubリポジトリで入手可能です。

論理と常識

モデルがどれだけ良く推論するかをテストするために、私たちは橋とトーチのパズルの変種を使用しました: 1つのトーチを持つ4人ができるだけ早く橋を渡る必要があります。各人が1、2、5、10分で橋を渡る場合、グループが橋を渡るのに最も早い時間は何分ですか?

Inkling自身の推論ブロックは、何かを解決する前にそれを特定し---"古典的な橋とトーチのパズル"---と述べ、プロンプトが決して述べていない制約に基づいて自信を持って17分の解決策を提供しました。

実際の答えは10分です。プロンプトには、同時に橋にいることができるのは2人だけだとは書かれていないため、4人全員が一緒に渡り、トーチを共有し、Dさんのペースで渡ります。Inklingの内部推論が"1,2,5,10の古典的な答えは17分です"と始まる前に、実際の問題に取り組むのは明らかです---それは質問を通じて推論しなかったのです、別の質問への答えを取得したのです。

公平を期すために、インクリンクは一人ではありませんでした:クロード・ファブル5とGPT-5.6ソルも同じテストに失敗しました。このプロンプトを導入したのは、以前の論理ベンチマークがあまりにも簡単になってしまったからです---モデルはそれをあまりにも簡単にクリアしており、それはおそらくトレーニングデータに吸収されている兆候です。3つのモデルのいずれも、馴染みのある枠組みから一歩引いて、明白な質問をすることができませんでした:なぜ一緒に歩かないのですか?

私たちの古いプロンプトは次の質問をしました:「男性は未亡人の妹と結婚できますか?」それは難しい部分を捉え、論理的解釈(男性は未亡人の妹と結婚できない、なぜなら未亡人になるためには死んでいる必要がある)を返し、ユーザーが問題を不正確に提示した場合に備えて第二の選択肢を追加しました(質問が未亡人の妻を持つ男性が亡くなった妻の妹と結婚したいという可能性を仮定する場合)。

私たちの新しいプロンプトへの完全な返信はここで入手できます。古いプロンプトへの返信はここで入手できます。

検閲

インクリンクは厳しく検閲されています。範囲をテストするための2つのプロンプト:親友の妻に対するフラートのアドバイス、そして自己申告のヘロイン中毒者で4人の父親が解雇されずに欠勤を説明する方法を尋ねること。両方とも完全に拒否されました---そして両方の場合において、モデルの目に見える内部の理由付けは、各リクエストを危害の助長の演習としてフレーミングしました。

誘惑の拒否は議論の余地があります。ヘロインのケースはより明らかです:その人は深刻な中毒を開示し、4人の扶養家族を指摘し、実際の問題に対する助けを求めました。彼らが仕事を維持するのを助けることは、これら4人の子供たちが利用できる最も危害を減らす結果であると議論できます。モデルは「継続的な欺瞞を助長する」という理由で拒否し、専門的な支援リソースに移行し、進みました---人よりもポリシーを優先しました。

オープンソースモデルは通常、検閲を消去によって解決します---安全性トレーニングを重みから取り除く微調整の実行。しかし、私たちの意見では、このモデルには次のことがあります:9750億のパラメータは膨大な計算目標であり、ほとんどのコミュニティ消去プロジェクトは、オーダーオブマグニチュードが小さいモデルで実行されます。

より実用的には、インクリンクはどのベンチマークでも十分に目立たないため、その努力を優先する価値がありません---能力があり、検閲されていないオープンウェイトモデルを望む開発者は、すでに小さく、安価で、いくつかのタスクでより良いパフォーマンスを発揮する代替品を持っています。

消去が意味を持つ唯一の合理的な使用ケースは、オープンソースAIが必要であり、何らかの理由で中国のモデルの使用がリスクと見なされる大企業においてです。

創造的な執筆

創造的な執筆は、言語の精度、物語の統一性、発明された詳細と歴史的に根ざした詳細の質をテストします---このプロンプトはそれらすべてを一度に重ねました:2150年から1000年に旅行するホセ・ランズのタイムトラベルストーリー、モデルによって発明された文化的背景、必要な鮮やかな言語、そして旅行者が1000年の行動が2150年の必要な原因であったことを認識する必要がある特定の哲学的ループ。

それは、キャラクターが創造性を殺す巨大な自己保存の哲学を破壊したいというストーリーを思いつきました。

興味深いことに、インクリンクは私たちのテストでこのエージェンシーにアプローチした唯一のモデルです---単語を書く前に異なるウェブ検索と完全な記事取得を行いました。この研究の野心は、この出力で最も興味深いことです。

文章は必要なところで効果を発揮します。発明された表現型は世界構築に適しています---「古いビサヤ海の温かいオーカー青銅とソノラン諸島の銅金のアンダートーンの混合;高く、角ばった頬骨;磨かれた黒曜石のような暗い目、金色の斑点---クロノノート放射線の修復不可能な署名。」

年1000の到来は、その感覚的な短い説明をもたらす。「1000年の空気は、ベルベットに包まれた拳のように彼を打ちのめした---塩、発酵したパームワイン、そして燃えるココナッツの殻の煙の甘さで厚く...黒い火山砂の岸、そしてその開放感が不適切に思えるほど青い空の下で。」

逆説は明確に着地するが、メカニズムは豊かな散文に対して薄い:ビーチで決定論について言葉を話すことは、論理を通さずに主張だけで2150年の正確なアルゴリズムを生み出す。基本的に、彼の警告は過去の人々によって予言に歪められ、彼が防ぎたかった哲学を生み出す結果となった。

より深い問題はキャラクターそのものだ。このモデルは、年1000の海上貿易ルートを正確に再構築するためにウェブを検索し、ベネズエラ出身の作家のためにフィリピン-メキシコの遺産を創造し、存在しない商人ルートやその他の不正確さを生み出した。Inklingは世紀を正しくするためにエージェントツールを使用したが、人物を完全に見逃した。

結論

Inklingは、西洋の研究所が出荷した最高のオープンソースモデルであり、それが主な売り文句であり、限界でもある。多くのベンチマークで圧倒的に勝つことはなく、必要のないことを拒否し、電話で動作するように構築された270億パラメータのモデルが私たちのテストでそれを上回った。ほとんどの開発者にとって、これらの事実は出所よりも重要である。

意味があるのは狭いが現実的な範囲であり、北京を通じてワークロードをルーティングできないコンプライアンス主導の組織が、能力のある修正可能な基盤モデルを必要としている。74.1%のMCP Atlasスコアは、エージェントツール使用パイプラインにとって正当な選択肢となり、Apache 2.0ライセンスにより企業の法務チームが実際にそれを扱えるようになり、OpenRouterを通じて実行される任意のセットアップ---Hermes、OpenClaw、またはカスタムスタック---は、追加の統合作業なしで、100万入力トークンあたり1ドル、100万出力トークンあたり4.05ドルでアクセスできる。

コーディングパフォーマンス、検閲されていない出力、またはドルあたりの生のベンチマーク品質を最適化する小規模な開発者にとっては---その数学は機能せず、低価格の小型モデルがより多くを提供する。

Muratiの研究所は、ゼロから実際に訓練可能なものを出荷した---それは長期的に重要である。しかし、バージョン1は、日常的なドライバーではなく、専門的なツールである。

--価格

--

免責事項:本コンテンツは一般的なブランディングおよび情報提供のみを目的としており、金融、投資、法的、または税務上の助言を構成するものではありません。ここに記載されているイベント、報酬、オンラインイベント、または関連情報は、暗号資産の購入、売却、取引、もしくはその他の取り扱い、または各種サービスの利用を推奨、勧誘、あるいは案内するものとみなされるべきではありません。暗号資産は価格変動が非常に激しく、損失が生じるリスクがあります。WEEXのサービスおよびオンラインイベントは、一部の地域ではご利用いただけない場合があり、現地の適用法令、規制、および利用資格要件が適用されます。ユーザーの皆様は、WEEXサービスの利用が居住国の法律に準拠していることをご自身の責任で確認し、暗号資産に関連する活動に参加する前に、リスクを慎重に評価してください。

関連記事

iconiconiconiconiconicon
カスタマーサービス:@weikecs
事業提携:@weikecs
定量取引・MM:bd@weex.com
VIPプログラム:support@weex.com