Kimi K3: Тиждень після випуску — консенсус, розбіжності, тенденції

By: rootdata|2026/07/22 02:54:00
0
Поширити
copy
Оцінити в GoogleОцінити в Google

Автори: Alan, Denise | Команда контенту Biteye

У епоху гонки озброєнь у сфері штучного інтелекту, перший день після випуску базової моделі часто є найскладнішим для оцінки.

Яскраві демонстрації з'являються в центрі уваги, результати бенчмарків повторно поширюються, теми, в яких модель досягає успіху, підкреслюються, а невдалі випадки ще не встигли з'явитися на поверхні. Але для звичайних користувачів і розробників, які дійсно планують інтегрувати модель у свої робочі процеси, лідерство в рейтингах не завжди означає стабільну доставку в повсякденних завданнях.

Тиждень після випуску виявляється більш підходящим моментом для спостереження.

Успішні моменти починають повторно перевірятися різними користувачами, проблеми з білими екранами, переробками, витратами ресурсів, пропущеними інструкціями та проблемами сумісності інструментів також починають з'являтися в постах і коментарях. Kimi K3 перебуває на цьому етапі.

Kimi K3 був випущений 16 липня 2026 року. Офіційно його визначають як модель довгострокового агента з параметрами 2.8T, яка нативно підтримує візуальний ввід і має контекстне вікно на 1 мільйон токенів. Приблизно через три дні після випуску запити користувачів наблизилися до межі потужності кластера, і Kimi тимчасово призупинив особисті підписки для нових користувачів, залишивши обчислювальні ресурси для існуючих членів.

Щоб максимально відтворити реальну позицію K3 серед глобальних розробників, ми систематично зібрали зворотний зв'язок від розробників, AI KOL та незалежних медіа, доступний для перевірки з 16 по 21 липня. 👇

1. Підсумок практичного використання: Що цікавого зробив Kimi K3?

Існуючі публічні тести можна умовно розділити на п'ять категорій: візуальна взаємодія та ігрові прототипи, повноцінна розробка та існуючі кодові бази, інтеграція апаратного та програмного забезпечення, робочі процеси агентів та безпека коду.

1. Візуальна взаємодія та ігрові прототипи

Це найбільш щільна категорія публічних випадків K3, а також частина, де звичайні користувачі найкраще відчувають різницю. Тестувальники не лише перевіряли, чи виглядає сторінка привабливо, але й фактично перевіряли рухи камери, фізичні правила, ігровий стан, адаптацію для мобільних пристроїв та багаторазові зміни.

Токсичний AI: 7 оригінальних завдань для перевірки візуальних, логічних та налагоджувальних аспектів

Токсичний AI розробив 7 оригінальних завдань, які охоплюють інтерактивні додатки, 3D портфоліо плаваючих островів, виявлення конфліктів вимог, налагодження багатопотокових умов, дослідження цін на довгі дистанції, мінімалістичний візуальний дизайн та фізичне моделювання в більярді.

Серед них, 3D плаваючий острів безпосередньо використовував ту ж саму підказку, що й для тестування чотирьох версій GPT-5.6, тому це більш порівнянно, ніж показувати яскраві демонстрації кожної моделі окремо. Завдання вимагало використання React та Three.js для реалізації чотирьох етапів руху камери, підсвічування, натискання для просування, Bloom, об'ємних хмар, частинок та динамічного неба.

Перший запуск K3 призвів до білого екрану, але після виправлення у другому раунді вдалося успішно запустити. Основні елементи, водоспад, хмари, переходи камери та ефекти для мобільних пристроїв були реалізовані, але завдання зайняло близько години, і на мобільних пристроях все ще існували проблеми з версткою.

Інше завдання "Кіберпанковий підземний клініка" вимагало створення трьох пацієнтів, прихованих сюжетних ліній, запасів кібернетичних частин та щонайменше трьох закінчень. Тестова команда фактично пройшла всі гілки, підтвердивши, що всі три закінчення можуть бути досягнуті, а вичерпання запасів також змінює доступні діагностичні варіанти. Цей проект перевіряв не лише візуальне генерування, але й управління станом, логіку гілок та прийнятність гри.

Джерело: https://mp.weixin.qq.com/s/Qe7RfIr2z9-Qlm6Xd1pE1A?scene=1

Aditya: Створення MMORPG стилю прототипу з однією підказкою та порівняння з Opus 4.8

Перше завдання Aditya полягало в тому, щоб за допомогою однієї підказки створити ігровий прототип у стилі MMORPG. Публічні записи показують, що завдання зайняло близько 55 хвилин, а вартість склала 9.37 доларів, готовий продукт включав верхову їзду, паркур по дахах, бої та відкритий світ для дослідження.

Друге завдання полягало в підключенні K3 та Opus 4.8 API в одному середовищі Cursor, використовуючи ту ж підказку для створення клону Crossy Road. Підказка чітко вимагала воксельного або низькополігонального стилю, програмованих доріг та річок, рухомих автомобілів, плаваючих плотів, попереджень про потяги, зіткнень та завершення гри, зростаючої складності, підрахунку очок, перезапуску, слідкування камери, 60FPS та модульного коду.

Обидві сторони створили ігри, які можна грати, та фізичні ефекти, які працюють. Інтерфейс K3 трохи більш вишуканий, вартість склала 7.11 доларів; вартість Opus склала 19 доларів.

Джерело: Записи тестування Aditya, переказ RoundtableSpace про випадки MMORPG

Сонячне дерево: Гра в Guess Color на Three.js та понад 40 стилів UI

У шести послідовних проектах Сонячне дерево змусив K3 використовувати Three.js для розробки 3D гри Mastermind. Перша версія вже була іграбельною та мала звукові ефекти, пізніше були додані функції перетягування, траєкторії руху кульок, хмарна база даних та таблиця лідерів.

Крім того, він змусив K3 створити навчальну сторінку UI, що містить понад 40 стилів, охоплюючи нову метафору, рідке скло та мінімалізм, щоб спостерігати за можливостями моделі в інтерфейсі, просторовому розташуванні та візуальному стилі.

Адреси проектів включають гру Mastermind 3D та навчальну сторінку стилів UI.

Джерело: Повний тест Сонячного дерева

2. Повна розробка, існуючі кодові бази та довгі контекстні завдання

Створення демо з нуля може лише свідчити про те, що модель може створити каркас. Читання старого коду, виявлення обмежень, модифікація кількох модулів, а потім компіляція, тестування та розгортання наближає до реальної розробки.

Сонячне дерево: Надання прав доступу до сервера, безперервна розробка та запуск 6 проектів

Сонячне дерево надав K3 права доступу до сервера, безперервно розробляючи та запускаючи 6 проектів, охоплюючи фронтенд, бекенд, бази даних, AI API, оптимізацію існуючих кодових баз та розробку інструментів. Він зафіксував типовий процес, коли один раунд діалогу завершує MVP, а потім 2-5 раундів доповнюють функції, виправляють інтерфейс та розгортають.

Одне з завдань полягало в аудиті існуючого репозиторію iOS на GitHub. K3 повідомив про 5 високих вразливостей, 4 проблеми з продуктивністю та 2 архітектурні проблеми, після чого запустив 5 Subagent для виправлення, завершив компіляцію та запустив емулятор iOS для ручного тестування.

Інше завдання полягало в створенні GIF стиснення для WeChat. Обмеження включали файл не більше 10MB, загальна кількість кадрів не більше 300, частота кадрів від 12 до 20fps. K3 завершив розробку інструменту за приблизно 10 хвилин, готовий продукт може об'єднувати довгі статичні кадри, видаляти зайві кадри та намагатися зберегти якість зображення, дотримуючись обмежень за розміром.

Цей проект вже має відкритий вихідний код: репозиторій qiaomu-tiny-gif на GitHub

Сонячне дерево також передав близько 820 тисяч рядків коду Rust K3 та GPT-5.6 Sol Ultra для повного аналізу; ще один сайт для пошуку китайських статей arXiv завершив розробку, розгортання та завантаження на GitHub під час нічного тривалого завдання. Публічна адреса досвіду — сайт для пошуку китайських статей arXiv.

Джерело: Повний тест Сонячного дерева

3. Інтеграція апаратного та програмного забезпечення

Електромагнітна хвиля Studio: Розробка та розгортання системи реального часу для голосових розмов

Завдання, яке електромагнітна хвиля Studio поставила перед K3, полягало не в тому, щоб "згенерувати фрагмент голосу", а в тому, щоб побудувати систему реального часу для голосових розмов у середовищі з RTX 3090.

Публічне відео надало дані про кожен етап: затримка від початку до кінця становила близько 1.5 до 2.5 секунд, STT розпізнавання — близько 0.88 секунд, перший токен LLM — близько 0.3 до 0.5 секунд, перший пакет TTS — близько 0.19 секунд, використання відеопам'яті — близько 20GB/24GB. Наступним кроком планується зменшити затримку до 500 мілісекунд.

Джерело: Тестування системи голосу електромагнітної хвилі

4. Робочі процеси агентів та безпека коду

Kun Chen: Підключення до FirstMate, спостереження за дотриманням інструкцій та витратами ресурсів

Kun Chen підключив K3 до FirstMate, використовуючи його протягом одного ранку. Довгі системні підказки FirstMate постійно вимагали від моделі діагностувати проблеми, розподіляти завдання та дотримуватися робочого процесу, тому це легше виявляло проблеми з дотриманням інструкцій, ніж одноразова демонстрація на веб-сторінці.

Він використовував пакет за 40 доларів. У рамках одного сеансу з контекстом близько 200K, він запустив лише кілька підказок, витративши приблизно третину вікна потужності на 5 годин. У практиці K3 зміг зрозуміти наміри, діагностувати проблеми та делегувати завдання, але швидкість відповіді була повільною, і він також пропустив деякі обмеження в системних підказках.

FirstMate вже відкритий: репозиторій kunchenguid/firstmate на GitHub

Джерело: Тестування K3 Kun Chen

Malte Ubl: Використання Deepsec для проведення оцінки безпеки на реальних кодових базах старих версій

Команда Malte Ubl протестувала кілька моделей на основі відкритого безпечного агента Harness Deepsec на старому Git коміті невідомого open-core додатку. Ця версія була випущена до виправлення великої кількості проблем безпеки, а завдання полягало в тому, щоб змусити модель шукати реальні вразливості в більшому кодовому репозиторії, уникаючи при цьому підвищення рейтингів у публічних тестах.

Публічні результати показують, що GPT-5.6 Sol має найвищу точність і відсоток повернення, але вартість одного запуску перевищує вартість другого місця в 7 разів. K3 є більш збалансованим у відсотках повернення, точності та ціні. GLM-5.2 дешевше приблизно на 40%, але має нижчий рівень повернення.

Deepsec вже відкрив код: репозиторій vercel-labs/deepsec на GitHub.

Джерело: приватна оцінка Deepsec Malte Ubl.

II. Оцінка KOL: Як вони оцінюють K3 після завершення

Китайські KOL: Визнають візуальні та інженерні досягнення, але більше зосереджуються на реальних результатах

  1. Xiangyang Qiaomu (@vista8, AI KOL, глобальний рейтинг XHunt: 891): Візуальні та просторові взаємодії виділяються, але архітектура та бекенд все ще потребують сильних обмежень.

Xiangyang Qiaomu вважає, що переваги K3 зосереджені на взаємодії, інтерфейсі, візуальних та просторових сценах, особливо підходять для фронтенд-інженерії, яка потребує зворотного зв'язку та безперервних корекцій. Дизайн архітектури та стабільність бекенду все ще не досягають рівня провідних закритих моделей.

Він також зауважив, що K3 надто активно підходить до розмитих завдань. Під час використання необхідно чітко визначити межі, заборони та критерії приймання в системних підказках або AGENTS.md, інакше модель може самостійно розширити межі завдання.

  1. PoisonAI: Потенціал дуже високий, але завершеність часто досягається через багаторазові виправлення.

Тестування PoisonAI показало, що K3 може одночасно обробляти візуальні, логічні, конфліктуючі вимоги та налагодження, але не всі завдання можуть бути виконані за один раз.

Проблеми з білим екраном, версткою на мобільних пристроях та помилками фронтенд-картографування свідчать про те, що висока завершеність кінцевого продукту зазвичай досягається через "генерацію, виконання, виявлення проблем, подальше виправлення", а не з першого разу.

Візуальний потенціал є перевагою, але час, витрати та стабільність першого запуску є реальними витратами.

  1. Electromagnetic Wave Studio: Цінність у проектуванні інженерії, а не в запуску великих моделей на одній картці.

Приклад системи голосового управління показує, що K3 може з'єднати розпізнавання голосу, LLM, синтез голосу та середовище розгортання в вимірювальну ланцюг.

Він підтримує висновок, що "K3 має здатність до інтеграції складних систем", але не підтримує твердження, що "повний K3 може працювати на одній локальній картці 3090".

Англомовні KOL: Порівняння K3 з аналогічними завданнями та реальними робочими процесами агентів.

  1. Chris (@ChrisGPT, AI журналіст, глобальний рейтинг XHunt: 1774): Довгий контекст допомагає підтримувати постійно еволюціонуючу інженерну траєкторію.

Після трьох раундів додавання нових механізмів, вже наявні функції все ще можуть працювати, що робить випадок Chris інтуїтивно зрозумілим з точки зору вартості 1M контексту.

Однак 3.24 долара - це лише витрати на виклик моделі, не включаючи витрати на мистецькі активи, дизайн ігор, тестування продуктивності, розгортання та ручний прийом, і на цій основі не можна виводити середній рівень успіху аналогічних ігор.

  1. TestingCatalog (@testingcatalog, AI медіа, глобальний рейтинг XHunt: 1924): Більш складні, більш привабливі, але не означає більш надійні.

Порівняння TestingCatalog показує чіткі компроміси. K3 готовий реалізувати більше візуальних та інтерактивних ефектів, тоді як Fable 5 завершує швидше, а UX компоненти є більш стабільними.

Аномалія в перспективі, викликана швидкістю 100-кратної планети, свідчить про те, що "більше функцій" і "вища доступність" повинні оцінюватися окремо.

  1. Kun Chen (@kunchenguid, індивідуальний розробник, глобальний рейтинг XHunt: 11462): Може розуміти та делегувати завдання, але повсякденний досвід обмежений швидкістю та дотриманням.

Kun Chen визнає здатність K3 розуміти наміри, діагностувати проблеми та делегувати завдання, одночасно зазначаючи, що його швидкість повільна, і він може пропустити частину обмежень у довгих системних підказках, а фактичні витрати на пакети не є легкими.

Проблеми з затримками на початку випуску можуть посилити затримки, але дотримання інструкцій та досвід витрат залишаються ближчими до повсякденного використання, ніж демонстраційні покази.

  1. Malte Ubl (@cramforce, CTO Vercel, глобальний рейтинг XHunt: 1425): Підходить для постійного сканування безпеки, але не досягає найвищої якості.

Рекомендація Malte полягає в тому, щоб спочатку використовувати GPT-5.6 Sol для створення високоякісної бази безпеки, а потім використовувати Kimi K3 для постійного аналізу.

Це означає, що позиціонування Kimi K3 у цій приватній оцінці не є першим за відсотком повернення, а є компромісним рішенням між якістю, точністю та ціною.

  1. Aditya (@adxtyahq, EntelligenceAI DevRel, глобальний рейтинг XHunt: 27714): Сильна сторона Kimi K3d - це співпраця кількох систем в одному запиті.

Два приклади Aditya показують, що K3 може одночасно обробляти генерацію сцен, фізичні правила, контроль введення та стан UI в одному середовищі Cursor за нижчою ціною, завершуючи ігрову версію Crossy Road.

III. Консенсус, розбіжності та роздуми

Через тиждень навколо K3 вже сформувалося кілька відносно стабільних консенсусів.

  1. Найбільш помітні можливості K3 - це візуальне кодування, фронтенд, 3D та прототипи ігор.

  2. 1M контекст підходить для великих репозиторіїв та довгих завдань, але не може замінити відбір контексту.

  3. Повільна реакція, велика кількість вихідних токенів - це найбільш поширені негативні відгуки.

  4. Остаточний ефект агента сильно залежить від інструментів, таких як Kimi Code, Claude Code, Cursor тощо.

  5. Ключові виробничі завдання все ще потребують тестування, відкату та ручного приймання.

Розбіжності в основному зосереджені на трьох питаннях.

  1. Чи дійсно це дешевше? ------ Прихильники підкреслюють низькі витрати на введення після кешування, противники підкреслюють загальні витрати на токени та витрати на переробку.

  2. Чи дійсно це наближається до провідних закритих моделей? ------ Різниця візуальних та фронтенд-завдань невелика, але складна логіка та загальний досвід все ще мають розрив.

  3. Чи можуть відкриті ваги дійсно сприяти локальному розгортанню? ------ Перспективи кастомізації обіцяють, але повна модель 2.8T не є масштабом, який звичайне споживче обладнання може легко витримати.

Насправді, якщо зібрати відгуки цих 10 KOL, можна виявити, що справжня дискусія стосується того, якими стандартами слід його оцінювати.

Kimi K3 вже продемонстрував достатньо переконливі результати у фронтенді, 3D та прототипах ігор. Але якщо стандартом є стабільна доставка у складних виробничих завданнях, він все ще повинен зіткнутися з випробуваннями швидкості, ефективності токенів, брудних даних та відновлення від аномалій.

Насправді, коли робочі процеси агентів поступово зріють, більш розумним підходом може бути розподіл завдань. Наприклад, візуальну генерацію можна доручити Kimi K3, складні міркування - більш стабільним gpt 5.6 sol або Claude fable 5, а відносно прості запити та повторювані операції можна доручити легким моделям, а потім завершити приймання за допомогою тестування та ручного перевірки.

У такому робочому процесі базова модель зовсім не повинна займати перше місце у всіх бенчмарках. Досить, щоб вона мала явну перевагу в одному з високочастотних етапів, а також щоб ціна, контекст або спосіб розгортання були достатньо привабливими, щоб стати незамінною частиною робочого процесу.

Капітальні вкладення та час очікування для великих моделей зрештою мають обмеження, і вони повинні швидко перетворюватися на продуктивність.

Отже, чи перевершить Kimi K3 або навіть китайські великі моделі OpenAI та Anthropic, рейтинги продовжать давати нові відповіді. Але питання, яке варто спостерігати, вже змінилося: коли різниця в можливостях між моделями продовжує зменшуватися, хто найбільше підходить для інтеграції в інструменти, потрапляння в робочі процеси та тривалого виклику, той і зможе виділитися в цій AI-конкуренції.

Примітка: Відгуки KOL у цій статті в основному взяті з публічних обговорень з 16 по 21 липня 2026 року, класифіковані та перефразовані Biteye. Точні витрати, час та рівень успіху є випадковими і не становлять стандартизованих бенчмарків. Параметри моделі, ціни, контекст, підписка та статус відкриття ваг є актуальними відповідно до останньої інформації від Kimi.

Ціна --

--

Відмова від відповідності: цей контент надано лише для загальних брендингових та інформаційних цілей і не є фінансовою, інвестиційною, юридичною чи податковою консультацією. Події, нагороди, онлайн-події або пов’язану інформацію, згадана тут, не слід розглядати як рекомендацію, прохання чи запрошення до купівлі, продажу, торгівлі чи інших операцій з криптоактивами або використання послуг. Криптоактиви є дуже волатильними та можуть призвести до збитків. Послуги WEEX та онлайн-події можуть бути недоступні в усіх регіонах та підпадають під дію чинних законів, правил та вимог до участі. Ви несете відповідальність за забезпечення відповідності використання вами послуг WEEX місцевому законодавству та за ретельну оцінку ризиків перед участю в діяльності, пов’язаній з криптовалютами.

Вам також може сподобатися

Вміст

Нещодавні лістинги монет на WEEX

iconiconiconiconiconicon
Підтримка клієнтів:@weikecs
Співпраця:@weikecs
Кількісна торгівля та маркетмейкінг:bd@weex.com
VIP-програма:support@weex.com