Kimi K3 発表から1週間の様子:合意、対立、大勢
著者:Alan、Denise|Biteye コンテンツチーム
AI軍拡競争の時代において、基盤モデルが発表された初日は、評価が最も歪む時でもあります。
ハイライトとなるデモが集中して現れ、ベンチマークの順位が繰り返し共有され、モデルが得意とする課題が強調され、失敗事例はまだ表面化していません。しかし、実際にモデルをワークフローに組み込もうとしている一般ユーザーや開発者にとって、ランキングでのリーダーシップは日常業務での安定した納品を意味しません。
発表から1週間は、むしろ観察に適した時期です。
成功事例が異なるユーザーによって繰り返し検証され、ホワイトスクリーン、再作業、リソース消費、指示の漏れ、ツールの互換性の問題が、投稿やコメント欄に次々と現れています。Kimi K3 はこの段階にあります。
Kimi K3 は2026年7月16日に発表されました。公式には、2.8Tのパラメータを持ち、視覚入力をネイティブにサポートし、100万トークンのコンテキストウィンドウを持つ長距離エージェントモデルと定義されています。発表から約3日後、ユーザーのリクエストはクラスターの容量上限に迫り、Kimiは新規ユーザー向けの個人サブスクリプションを一時停止し、計算能力を既存の会員に優先的に提供しました。
K3が世界の開発者の中で実際にどのような位置にあるのかをできるだけ再現するために、7月16日から21日までの間に公開されている検証可能な開発者、AI KOL、独立メディアのフィードバックを体系的に整理しました。👇
1. 全ネット実践まとめ:Kimi K3 はどのような面白いことをしましたか?
現在の公開テストは大きく分けて5つのカテゴリに分類できます:視覚インタラクションとゲームプロトタイプ、フルスタック開発と既存コードベース、ソフトウェアとハードウェアのシステム統合、エージェントワークフローとコードセキュリティ。
1. 視覚インタラクションとゲームプロトタイプ
これはK3の公開ケースが最も集中しているカテゴリであり、一般ユーザーが最も違いを感じやすい部分です。テスターはページが美しいかどうかを見るだけでなく、実際にカメラの動き、物理法則、ゲームの状態、モバイル端末への適応、多回の修正をチェックしました。
毒AI:7つのオリジナルタスクを分解して視覚、論理、デバッグをテスト
毒AIは7つのオリジナルタスクを設計し、それぞれインタラクティブアプリケーション、3Dフローティングアイランドポートフォリオ、要求の対立認識、競合条件のバグデバッグ、長距離価格調査、ミニマルビジュアルデザイン、ビリヤード物理推論をカバーしました。
その中で、3Dフローティングアイランドは以前のGPT-5.6の4つのバージョンの同じプロンプトを直接再利用したため、各モデルがそれぞれ選んだハイライトデモを示すよりも比較可能性が高くなりました。タスクはReactとThree.jsを使用して、4つのセグメントのスクロールカメラの動き、ホバリング発光、クリック推進、ブルーム、ボリューム雲、パーティクル、動的な空を実現することを要求しました。
K3の最初の実行ではホワイトスクリーンが発生し、2回目の修正後に成功裏に起動しました。主体、滝、雲層、カメラのトランジション、モバイル端末のエフェクトのダウングレードは基本的に実現されましたが、タスクには約1時間かかり、モバイル端末には依然としてレイアウトの問題がありました。
別のタスク「サイバーパンク地下クリニック」では、3人の患者、隠されたストーリーライン、義体パーツの在庫、少なくとも3つの結末を生成することが求められました。テストチームはすべての分岐を実際に通過し、3つの結末に到達できることを確認しました。在庫が尽きると選択可能な診断プランも変わります。このプロジェクトで測定されたのは視覚生成だけでなく、状態管理、分岐論理、遊びやすさの受け入れも含まれています。
出典:https://mp.weixin.qq.com/s/Qe7RfIr2z9-Qlm6Xd1pE1A?scene=1
Aditya:単一プロンプトでMMORPGスタイルのプロトタイプを作成し、Opus 4.8と同題で比較
Adityaの最初のタスクは、単一のプロンプトを使用してプレイ可能なMMORPGスタイルのプロトタイプを生成することでした。公開記録によると、タスクには約55分かかり、費用は9.37ドルで、完成品には馬に乗ること、屋根の上を駆け回ること、戦闘、探索可能なオープンワールドが含まれています。
2つ目のタスクでは、同じカーソル環境でK3とOpus 4.8 APIを接続し、同じプロンプトを使用してCrossy Roadのクローンを生成しました。プロンプトはボクセルまたは低ポリゴンスタイル、プログラム的な道路と川、移動する車両、浮遊する木製筏、列車の警告、衝突とゲームオーバー、難易度の増加、スコア、再開、カメラ追従、60FPS、モジュール化コードを明確に要求しました。
両者ともにプレイ可能なゲームと使用可能な物理効果を生み出しました。K3のUIはやや洗練されており、費用は7.11ドル、Opusの費用は19ドルでした。
出典:Adityaのテスト記録、RoundtableSpaceによるMMORPGケースの伝達
向陽ジョ木:Three.jsを使用した色当てゲームと40種類以上のUIスタイルページ
連続して完了した6つのプロジェクトの中で、向陽ジョ木はK3にThree.jsを使用して3D Mastermind色当てゲームを開発させました。第一版はすでにプレイ可能で音声効果もあり、後にドラッグアンドドロップの並べ替え、小球の移動軌跡、クラウドデータベース、ランキングが追加されました。
さらに、彼はK3に40種類以上のスタイルを含むUI学習ページを生成させ、新しい擬似的、液体ガラス、ミニマリズムなどのさまざまなデザイン言語をカバーし、モデルのインターフェース、空間レイアウト、視覚スタイルのカバレッジ能力を観察しました。
プロジェクト体験アドレスにはMastermind 3DゲームとUIスタイル学習ページが含まれています。
出典:向陽ジョ木の完全な実測
2. フルスタック開発、既存コードベースと長いコンテキストタスク
ゼロからデモを生成することは、モデルがフレームを構築することを示すだけです。古いコードを読み取り、制約を認識し、複数のモジュールを修正し、コンパイル、テスト、デプロイを経て、真の開発に近づきます。
向陽ジョ木:サーバー権限を与え、連続して6つのプロジェクトを開発し、オンラインにしました
向陽ジョ木はK3にサーバー権限を与え、連続して6つのプロジェクトを開発し、オンラインにしました。これにはフロントエンド、バックエンド、データベース、AI API、既存コードベースの最適化、ツール開発が含まれます。彼が記録した典型的なプロセスは、1回の対話でMVPを完成させ、その後2〜5回の補完機能、インターフェースの修正、デプロイを行うことです。
その中の1つのタスクは、既存のiOS GitHubリポジトリを監査することでした。K3は5つの高危険脆弱性、4つのパフォーマンス問題、2つのアーキテクチャ問題を報告し、その後5つのサブエージェントを起動して修正を分担し、コンパイルを完了し、iOSシミュレーターを起動して人間の体験を提供しました。
別のタスクは、WeChat公式アカウント用のGIF圧縮スキルを作成することでした。制約条件には、ファイルサイズが10MBを超えないこと、総フレーム数が300フレームを超えないこと、フレームレートが12〜20fpsに制御されることが含まれます。K3は約10分でツール開発を完了し、完成品は長時間静止フレームを結合し、冗長フレームを削除し、サイズ制限を満たしながら画質をできるだけ保持します。
このプロジェクトのソースコードは公開されています:qiaomu-tiny-gif GitHubリポジトリ
向陽ジョ木は約82万行のRustコードをK3とGPT-5.6 Sol Ultraにそれぞれ全量分析させました。また、別のarXiv中国語検索サイトが夜間の長タスクで開発、デプロイ、GitHubへのアップロードを完了しました。公開体験アドレスはarXiv中国語検索サイトです。
出典:向陽ジョ木の完全な実測
3. ソフトウェアとハードウェアのシステム統合
電磁波スタジオ:リアルタイム音声対話システムの開発とデプロイ
電磁波スタジオがK3に与えたタスクは「音声を生成する」ことではなく、RTX 3090のデプロイ環境でリアルタイム音声対話システムを構築することでした。
公開ビデオは各段階のデータを示しました:エンドツーエンドの応答時間は約1.5〜2.5秒、STT認識は約0.88秒、LLMの最初のトークンは約0.3〜0.5秒、TTSの最初のパッケージの音声出力は約0.19秒、メモリ使用量は約20GB/24GBです。次のステップは、応答遅延を500ミリ秒以内に圧縮することです。
出典:電磁波スタジオの音声システム実測
4. エージェントワークフローとコードセキュリティ
Kun Chen:FirstMateを接続し、指示遵守とリソース消費を観察
Kun ChenはK3をFirstMateに接続し、午前中ずっと使用しました。FirstMateの長いシステムプロンプトは、モデルに問題を診断し、タスクを割り当て、ワークフローを遵守するように要求するため、一度きりのウェブデモよりも指示遵守の問題を明らかにしやすくなります。
彼が使用したのは40ドルのプランです。約200Kのコンテキストの単一セッションで、いくつかのプロンプトを実行しただけで、5時間のリソースウィンドウの約3分の1を消費しました。実践の中で、K3は意図を理解し、問題を診断し、タスクを委任することができましたが、応答速度は遅く、システムプロンプトの一部の制約を見逃すこともありました。
FirstMateはすでにオープンソース化されています:kunchenguid/firstmate GitHubリポジトリ
出典:Kun ChenのK3実測
Malte Ubl:Deepsecを使用して古いバージョンの実際のコードベースでセキュリティ評価を実行
Malte Ublチームは、オープンソースのセキュリティエージェントHarness Deepsecを使用して、公開されていないオープンコアアプリの古いGitコミット上で複数のモデルをテストしました。このバージョンは、多くのセキュリティ問題が修正される前に位置しており、モデルが大規模なコードベース内で実際の脆弱性を探し出す一方で、公開された問題集に対してスコアを上げることを避けるというタスクが与えられました。
公開された結果によると、GPT-5.6 Solのリコール率と精度が最も高いですが、単回の実行コストは2位の7倍を超えます。K3はリコール率、精度、価格のバランスが取れています。GLM-5.2はK3より約40%安価ですが、リコールレベルは低いです。
Deepsecはすでにオープンソース化されています:vercel-labs/deepsec GitHubリポジトリ
出典:Malte UblのDeepsecプライベート評価
二、KOLの評価:完了後、彼らはどのようにK3を評価したか
中国のKOL:視覚とエンジニアリングの突破を肯定し、実際の納品により関心を持つ
- 向陽乔木(@vista8、AI KOL、XHuntグローバルAIランキング:891):視覚と空間の相互作用が際立っているが、アーキテクチャとバックエンドには依然として強い制約が必要
向陽乔木は、K3の利点がインタラクション、インターフェース、視覚、空間シーンに集中しており、特にスクリーンショットのフィードバックと連続的な修正が必要なフロントエンドエンジニアリングに適していると考えています。アーキテクチャ設計とバックエンドの安定性は、トップクラスのクローズドソースモデルには及びません。
彼はまた、K3が曖昧なタスクに対して過度に積極的であることを警告しています。使用時には、システムプロンプトやAGENTS.md内で明確に修正範囲、禁止事項、受け入れ基準を指定する必要があります。そうしないと、モデルがタスクの境界を自発的に拡大する可能性があります。
- 毒AI:能力の上限は非常に高いが、完成度は多くの修正から来ることが多い
毒AIの7つのテストは、K3が視覚、論理、要求の衝突、デバッグを同時に処理できることを示していますが、すべてのタスクが一度の実行で納品されるわけではありません。
最初の白画面、モバイル端末のレイアウト問題、フロントエンドのマッピングバグは、最終製品の高い完成度が通常「生成、実行、問題発見、修正継続」から来ることを示しています。視覚的な上限は利点ですが、時間、コスト消費、初回の安定性は現実的なコストです。
- 電磁波スタジオ:価値はエンジニアリングの編成にあり、単一のカードで大きなモデルを実行することではない
音声システムのケーススタディは、K3が音声認識、LLM、音声合成、デプロイメント環境を測定可能なリンクとして結びつけることができることを示しています。
それは「K3が複雑なシステム統合能力を持つ」という判断を支持しますが、「完全なK3が単一の3090でローカルに実行できる」という主張は支持しません。
英語のKOL:K3を同じテーマの比較と実際のエージェントワークフローに組み込む
- Chris(@ChrisGPT、AI業界記者、XHuntグローバルAIランキング:1774):長いコンテキストは持続的な進化のエンジニアリングトレースを維持するのに役立つ
3回の新しいメカニズムの追加後、既存の機能は引き続き動作し、Chrisのケースは1Mコンテキストの価値の直感的なサンプルとなります。
ただし、3.24ドルはモデルの呼び出し料金に過ぎず、アート資産、ゲームデザイン、パフォーマンステスト、デプロイメント、人工受け入れは含まれておらず、同様のゲームの平均成功率を導き出すことはできません。
- TestingCatalog(@testingcatalog、AIインテリジェンスメディア、XHuntグローバルAIランキング:1924):より複雑で、より目を引くが、より信頼できるとは限らない
TestingCatalogの同じテーマの比較は明確なトレードオフを示しています。K3はより多くの視覚的およびインタラクティブな効果を実現しようとしますが、Fable 5はより早く完成し、UXコンポーネントもより安定しています。
100倍の惑星速度によって引き起こされる視点の異常は、「機能が多い」と「使いやすさが高い」は別々に評価する必要があることを示しています。
- Kun Chen(@kunchenguid、個人開発者、XHuntグローバルAIランキング:11462):タスクを理解し、委任できるが、日常の体験は速度と遵守性に制約される
Kun Chenは、K3が意図を理解し、問題を診断し、タスクを委任する能力を認めていますが、同時にその速度が遅く、長いシステムプロンプトの一部の制約を見逃すことがあり、実際のパッケージのコスト消費は軽くないことを指摘しています。
リリース初期のサービスの混雑は遅延を拡大する可能性がありますが、指示の遵守とコスト体験は、デモ型の展示よりも日常使用に近い観察です。
- Malte Ubl(@cramforce、Vercel CTO、XHuntグローバルAIランキング:1425):持続的なセキュリティスキャンの主力に適しているが、最高品質の基準には達しない
Malteの提案は、まずGPT-5.6 Solを使用して高品質のセキュリティ基準を確立し、その後Kimi K3を使用して継続的な分析を行うことです。
これは、Kimi K3がこのプライベートテストでの位置付けがリコール率第一ではなく、品質、精度、価格の折衷案であることを意味します。
- Aditya(@adxtyahq、EntelligenceAI DevRel、XHuntグローバルAIランキング:27714):Kimi K3dの強みは、1つのプロンプト内での複数システムの協調
Adityaの2つのケースは、K3が1回の長いタスクでシーン生成、物理ルール、入力制御、UI状態を同時に処理し、同じカーソル環境で低コストで遊べるCrossy Roadのクローンを完成させることができることを示しています。
三、合意、相違、そして考察
1週間後、K3に関するいくつかの比較的安定した合意が形成されました。
K3の現在最も際立った能力は、視覚コーディング、フロントエンド、3D、ゲームプロトタイプです。
1Mコンテキストは大規模なリポジトリと長いタスクに適していますが、コンテキストのフィルタリングの代わりにはなりません。
応答が遅く、出力トークンが多いことは、現在最も一般的な否定的フィードバックです。
エージェントの最終的な効果は、Kimi Code、Claude Code、Cursorなどのツール環境に高度に依存します。
重要な生産タスクには、依然としてテスト、ロールバック、人工受け入れが必要です。
相違点は主に3つの問題に集中しています。
本当に安くなったのか?------支持者はキャッシュヒット後の低入力コストを強調し、反対者は総トークンと再作業コストを強調します。
本当にトップクラスのクローズドソースモデルに近づいたのか?------視覚とフロントエンドタスクの差は小さいが、複雑な論理と全体的な体験には差があります。
オープンウェイトは本当にローカルデプロイを促進できるのか?------カスタマイズの余地は期待されますが、完全な2.8Tモデルは一般消費者向けハードウェアが簡単に扱える規模ではありません。
実際、これら10人のKOLのフィードバックをまとめると、皆が本当に議論しているのは、何の基準でそれを評価すべきかということです。
Kimi K3はフロントエンド、3D、ゲームプロトタイプで十分に説得力のある結果を示しています。しかし、基準が複雑な生産タスクにおける安定した納品であるなら、速度、トークン効率、汚れたデータ、異常回復の試練に直面しなければなりません。
実際、エージェントワークフローが成熟するにつれて、より合理的なアプローチはタスクを分割することかもしれません。たとえば、視覚生成をKimi K3にパッケージ化し、複雑な推論をより安定したgpt 5.6 solまたはClaude fable 5に任せ、比較的簡単な検索と繰り返し操作は軽量モデルに任せ、最後にテストと人工レビューで受け入れを完了することです。
このようなワークフローでは、使用される基モデルはすべてのベンチマークで1位を獲得する必要はありません。高頻度のセクションで明らかな利点を形成し、同時に価格、コンテキスト、またはデプロイ方法が十分に魅力的であれば、ワークフローの中で不可欠な部分となることができます。
大規模モデルへの資本投入と待機期間には限界があり、迅速に生産力に転換する必要があります。
したがって、Kimi K3や国産大規模モデルがOpenAIやAnthropicを超えるかどうかは、ランキングが新しい答えを示し続けるでしょう。しかし、より注目すべき問題は変わりました:モデル間の能力差が縮小する中で、誰が最もツールに接続され、ワークフローに組み込まれ、長期的に呼び出される可能性が高いか、誰がこのAI競争で際立つことができるかです。
注:この記事のKOLのフィードバックは、2026年7月16日から21日までの公開討論から主に取られ、Biteyeによって分類および要約されています。正確なコスト、時間、成功率は個別のケースであり、標準化されたベンチマークを構成するものではありません。モデルのパラメータ、価格設定、コンテキスト、サブスクリプション、およびウェイトのオープン状態は、Kimiの公式最新情報に基づいています。
免責事項:本コンテンツは一般的なブランディングおよび情報提供のみを目的としており、金融、投資、法的、または税務上の助言を構成するものではありません。ここに記載されているイベント、報酬、オンラインイベント、または関連情報は、暗号資産の購入、売却、取引、もしくはその他の取り扱い、または各種サービスの利用を推奨、勧誘、あるいは案内するものとみなされるべきではありません。暗号資産は価格変動が非常に激しく、損失が生じるリスクがあります。WEEXのサービスおよびオンラインイベントは、一部の地域ではご利用いただけない場合があり、現地の適用法令、規制、および利用資格要件が適用されます。ユーザーの皆様は、WEEXサービスの利用が居住国の法律に準拠していることをご自身の責任で確認し、暗号資産に関連する活動に参加する前に、リスクを慎重に評価してください。
関連記事

CoinSharesがビットコインマイニングETFで欧州初進出

7月22日の仮想通貨|ストラテジー、ビットコイン準備金で配当31年分カバー可能に

韓国資金が中国のテクノロジー株を買い増し、寒武紀が単週で285.77万ドルの純買い入れで首位に

「ナラティブ」の時代は終わった…タイガーリサーチ、2026年の暗号市場はPMFが分ける

昨夜今晨の重要情報(7月21日-7月22日)

Wavelengthが誕生、アプリとAIエージェントでビットコインの支払いを簡素化

次の牛市の主戦場はどこか?答えはこの2つの資産に隠されている

フランクリン・テンプルトン:エージェントAIこそがブロックチェーンの「キラーアプリケーション」

ASMLの生産拡大、TSMCの増資:AIチップの「第二波」、なぜ市場はまだ不満なのか?

SpaceX、史上最大の株式ロック解除:1160億ドルの株式が8月6日に流通開始

Web 2.5で価値を得るのは誰か?

ムーブメントラボが破産申請、MOVEトークン不正問題の余波受け

シティのアナリストが80%の成功率で見落とされているAI株を推奨

ホルムズ海峡に続き紅海も「クン」…フーティの脅威でサウジの迂回路が停止

ウォール街で半導体株が回復:上昇の理由とは

ビザのステーブルコイン財務エンジンが機関金融における決済を深化させる

原油が90ドルの脅威にもかかわらずビットコインは6万6000ドルを維持…その理由は何か

ジャック・マラーズがトウェンティ・ワンを離れ、ストライクがテザーの3者間ビットコイン合併から撤退

AztecがV5にアップグレード、分散型Ethereum L2に完全なプライベート実行環境を追加

量子コンピュータはまだ来ていないが、中本聡の110万BTCが問題になっている

モルガン・スタンレーの解釈:コーニングのAI光学需要は強いが、利益はなぜ追いつかないのか?

フィデリティ投資、機関向けSMA製品ラインを拡大し、8つのカスタマイズおよびモデル戦略を新たに追加

L2の「再調整」:L1が独自のロールアップになると、イーサリアムの最終目標は何か?

Circleが国家信託銀行のライセンスを取得、ステーブルコイン発行者はどのようにして銀行に変わったのか?

ジョークから数十億ドルへ:メモコインとは何か、そしてなぜこの現象が暗号市場を支配しているのか

デジタル資産サービスの入り口、オンチェーンデータインフラ - タイガーリサーチ

お金の永遠の断片:サードパーティの支払いに第一原理はない

梁文鋒は生活がなく、楊植麟は退路がない

マーケットメーカーの解明:BTCの底は近いかもしれない、注目すべき信号

