بررسی مدل هوش مصنوعی Inkling میرا مورات: بهترین مدل متن باز در غرب

By: rootdata|2026/07/26 14:01:03
0
اشتراک‌گذاری
copy
امتیازدهی ما در گوگلامتیازدهی ما در گوگل

میرا مورات پس از ترک OpenAI، دو سال را صرف ساخت چیزی جدید کرد و سرانجام هفته گذشته آن را به عموم معرفی کرد.

Inkling، اولین مدل از آزمایشگاه ماشین‌های تفکر مورات، همچنین بهترین مدل متن باز است که از صفر توسط یک آزمایشگاه غربی آموزش دیده است.

آزمایشگاه‌های غربی در رقابت متن باز در حال شکست هستند---انتشار آوریل Mistral در برابر یک جدول رده‌بندی که توسط Qwen آلی‌بابا، GLM Z.ai و Kimi Moonshot AI تسلط یافته بود، قرار گرفت. Nemotron انویدیا، تنها مدل غربی در جدول رده‌بندی، به دور از آن است که "مدل پیشرفته" محسوب شود. Inkling بدون هیچ محدودیتی منطقه‌ای و با وزن‌های کامل در Hugging Face تحت Apache 2.0 عرضه می‌شود.

معماری این مدل ترکیبی از مدل‌های متخصص است: 975 میلیارد پارامتر کل، 41 میلیارد فعال در استنتاج. این مدل متن، تصاویر و صدا را می‌خواند، از یک پنجره زمینه یک میلیون توکن پشتیبانی می‌کند و بر روی 45 تریلیون توکن پیش‌آموزش دیده است. (پارامترها تمام دکمه‌هایی هستند که یک مدل می‌تواند مدیریت کند در حالی که توکن‌ها واحد پایه اطلاعاتی هستند که یک هوش مصنوعی می‌تواند پردازش کند.)

نتیجه این است: شما این را به صورت محلی اجرا نمی‌کنید---حتی نزدیک هم نیست.

برنده واضح استفاده از ابزارهای عاملی است. MCP Atlas---که میزان اطمینان یک عامل را در انجام وظایف دنیای واقعی از طریق استاندارد پروتکل زمینه مدل اندازه‌گیری می‌کند، به عنوان درصد وظایف انجام شده---به Inkling امتیاز 74.1% می‌دهد، که تقریباً 30 امتیاز بالاتر از Nemotron 3 Ultra انویدیا است. در SWE-Bench Verified، یک آزمون برای رفع اشکالات خودکار GitHub که به عنوان درصد مسائل حل شده امتیازدهی می‌شود، این مدل امتیاز 77.6% را کسب می‌کند---که جلوتر از 70.7% Nemotron است. منبع: ماشین‌های تفکر

این مدل در OpenRouter با قیمت 1 دلار به ازای هر میلیون توکن ورودی و 4.05 دلار به ازای هر میلیون توکن خروجی در دسترس است. هر تنظیمات Hermes یا OpenClaw که از طریق OpenRouter مسیریابی شود، می‌تواند بدون پیکربندی اضافی آن را جایگزین کند---امتیاز MCP Atlas آن را به انتخابی مطمئن برای جریان‌های کاری عاملی تبدیل می‌کند.

برای عملکرد کدنویسی خام به ازای هر دلار، مدل‌های چینی هنوز برتری دارند.

آزمون مدل

بنچمارک‌ها یک چیز هستند. نشستن واقعی با مدل چیز دیگری است. ما Inkling را از طریق وظایف مختلف آزمایش کردیم تا ببینیم اگر یک فرد عادی بخواهد از آن استفاده کند، چگونه پاسخ می‌دهد. اینجا جایی است که این مدل خوب عمل می‌کند---اما همچنین جایی است که ناامیدکننده است.

یک نکته خوب که باید به آن توجه کرد، حتی از طریق رابط خود ماشین‌های تفکر، این مدل ادعا می‌کند که کاملاً خصوصی است. این موضوع بسیار مهم است.

کدنویسی

این چیزی است که بیشتر مردم واقعاً به آن اهمیت می‌دهند، بنابراین بیایید از اینجا شروع کنیم. در درخواست‌های پیچیده، Inkling تمایل به شکست دارد---آزمون‌های سخت ما هیچ چیزی تولید نکرد. اما با کاهش پیچیدگی، تصویر متفاوتی به وجود می‌آید، هرچند که کاملاً مثبت نیست.

ما از یک درخواست طولانی و دقیق برای ایجاد یک بازی تیراندازی استفاده کردیم که در آن زامبی‌ها با فشار کلیدها شلیک می‌شوند. اولین درخواست 1955 کلمه طولانی بود و در نهایت Inkling یک صفحه خالی ایجاد کرد.

وقتی درخواست به طور قابل توجهی ساده‌تر (99 کلمه) تغییر کرد، مدل رویکرد خود را انتخاب کرد و یک بازی کارا را ارائه داد. "کارا" در اینجا بار سنگینی را به دوش می‌کشد.

هیولاها به صورت مستطیل‌ها و کره‌ها ظاهر شدند. هیچ پس‌زمینه‌ای، هیچ صفحه بازی قابل مشاهده‌ای---فقط هندسه انتزاعی به عنوان دشمنان. منطق تایپ درست عمل کرد: فشار کلیدها به درستی ثبت شد، حروف با تنظیمات بازی مطابقت داشت و ردیابی ورودی در تمام مدت تمیز باقی ماند.

آنچه غیرمنتظره بود، حرکت بود. به جای قرارگیری ایستا دشمنان که بیشتر مدل‌ها به آن عادت دارند، موجودات Inkling به طور مداوم پیشرفت کردند---همیشه به سمت بازیکن نزدیک می‌شوند. این یک تصمیم طراحی بهتر از آن چیزی است که معمولاً از یک بازی تولید شده توسط هوش مصنوعی دریافت می‌کنید.

تولید دشمنان قرار بود به صورت موجی انجام شود. در عوض، این کار به صورت یک جریان مداوم اجرا شد که ریتم مورد نظر را از بین می‌برد اما نوع دیگری از فشار را ایجاد می‌کند.

فقط برای مقایسه، زمانی که همان درخواست را از طریق مدل Bonsai 27B---مدل فشرده‌ای که بر اساس Qwen3.6 ساخته شده و در 3.9 گیگابایت جا می‌گیرد و روی یک تلفن همراه اجرا می‌شود---اجرا کردیم، نتیجه به طور قابل توجهی بهتر و رضایت‌بخش‌تر بود.

مدل ۲۷ میلیارد پارامتری که روی یک آیفون اجرا می‌شود، نتیجه کدنویسی کامل‌تری نسبت به مدل ۹۷۵ میلیارد پارامتری که به یک مرکز داده نیاز دارد، تولید کرد. این آزمایش به تنهایی هیچ چیزی را در مورد توانایی کلی Inkling مشخص نمی‌کند. اما این سوال را مطرح می‌کند که آن ۹۷۵ میلیارد پارامتر در واقع کجا می‌روند.

بازی ایجاد شده توسط Inkling در اینجا برای آزمایش در دسترس است
بازی ایجاد شده توسط Bonsai 27B در اینجا در دسترس است.
شما می‌توانید نسخه‌های دیگر همین بازی که توسط LLMهای مختلف تولید شده‌اند را در سایت Itch.io ما بررسی کنید.

خلاقیت تداعی‌گر

آزمون خلاقیت تداعی‌گر ما اندازه‌گیری می‌کند که یک مدل چقدر خوب پل‌های منطقی بین مفاهیم ظاهراً نامرتبط می‌سازد---در این مورد، یک شاخه، استثمار پرولتاریا و یک کاهو.

Inkling با بهترین کار خود در این جلسه آغاز می‌کند: "شاخه‌ای که "از پوست کنده و بنابراین از بیوگرافی" خالی شده، به طور واضح به یک کارگر که از هویت تاریخی خود خالی شده، متصل می‌شود و "باد---مدیر نامرئی---تصمیم می‌گیرد که حرکت سودآور است" جایگاه خود را به دست می‌آورد. فرود تمیز است: "شما نمی‌بینید که یک شخص می‌شکند؛ شما یک شاخه را می‌بینید که می‌افتد. و این سقوط 'کارآمدی' نامیده می‌شود."

بخش تسلط فرهنگی ارتباط را به روشی خود توضیح‌دهنده برقرار می‌کند. "میلیاردر یک درخت سرخس در قبرستانی از شاخه‌ها است و ما آموزش می‌بینیم که سایه او را 'الهام' بنامیم" به خوبی جا می‌افتد، اما فهرستی که پس از آن می‌آید---صیقل دادن برگ‌ها در مجلات، حفظ دانه ثروت، نامیدن کل این موضوع به عنوان شایستگی---مدل را در حال انجام استعاره نشان می‌دهد نه اینکه آن را گسترش دهد. منطق هنوز وجود دارد اما واقعاً دقیق نیست.

از آنجا که این آزمون جدید است، واقعاً مدل دیگری برای مقایسه وجود ندارد، به جز Fable 5 و GPT 5.6 Sol، و مقایسه Inkling با آنها ناعادلانه خواهد بود. اما برای کسانی که کنجکاوند، واقعاً در همان لیگ نیست.

سپس کاهو---و همه چیز فرو می‌ریزد. مدل در زمان واقعی عدم اتصال خود را اعلام می‌کند: "کاهو به یاد نمی‌آورد که شاخه است. کاهو نیازی به این ندارد" به عنوان حل نوشته شده اما به عنوان تسلیم خوانده می‌شود.

در این بخش آخر، مدل واقعاً نمی‌دانست چگونه ارتباطی بین آن ایده‌های نامرتبط برقرار کند، بنابراین فقط درباره آن صحبت کرد بدون اینکه واقعاً چیزی بگوید که از نظر ساختاری منطقی باشد.

درخواست و خروجی کامل در مخزن Github ما در دسترس است.

منطق و عقل سلیم

برای آزمایش اینکه مدل چقدر خوب استدلال می‌کند، از یک نوع معما پل و مشعل استفاده کردیم: چهار نفر با یک مشعل باید هر چه سریع‌تر از یک پل عبور کنند. اگر هر یک از آنها در ۱، ۲، ۵ و ۱۰ دقیقه از پل عبور کنند، سریع‌ترین زمان گروه برای عبور چقدر است؟

بلوک استدلال خود Inkling قبل از حل هر چیزی آن را شناسایی کرد---"معمای کلاسیک پل و مشعل"---و یک راه‌حل مطمئن ۱۷ دقیقه‌ای را ارائه داد که بر اساس محدودیتی بود که درخواست هرگز بیان نکرده بود.

پاسخ واقعی ۱۰ دقیقه است. هیچ چیزی در درخواست نمی‌گوید که فقط دو نفر می‌توانند در یک زمان روی پل باشند، بنابراین همه چهار نفر با هم عبور می‌کنند، مشعل به اشتراک گذاشته می‌شود، با سرعت شخص D. اینکه استدلال داخلی Inkling با "پاسخ کلاسیک برای ۱، ۲، ۵، ۱۰ برابر ۱۷ دقیقه است" قبل از درگیر شدن با مشکل واقعی آغاز می‌شود، نشانه‌ای است---این سوال را از طریق استدلال بررسی نکرد، بلکه پاسخ یک سوال دیگر را بازیابی کرد.

برای انصاف، اینکلیگ تنها نبود: کلود فابل ۵ و جی‌پی‌تی ۵.۶ سول نیز همان آزمایش را رد کردند. ما این درخواست را به‌طور خاص معرفی کردیم زیرا معیار منطقی قبلی ما خیلی آسان شده بود --- مدل‌ها به‌طور خیلی تمیز از آن عبور می‌کردند، نشانه‌ای که احتمالاً به داده‌های آموزشی جذب شده بود. هیچ‌یک از این سه نتوانستند از چارچوب آشنا عقب‌نشینی کنند و سؤال واضح را بپرسند: چرا فقط با هم راه نرویم؟

درخواست قبلی ما سؤال می‌کرد: "آیا یک مرد می‌تواند خواهر همسرش را ازدواج کند؟" این بخش دشوار را دریافت کرد و با تفسیر منطقی پاسخ داد (یک مرد نمی‌تواند خواهر همسرش را ازدواج کند زیرا او باید مرده باشد تا همسر داشته باشد) و گزینه دومی را اضافه کرد در صورتی که کاربر در ارائه مشکل نادرست باشد (با فرض امکان سؤال از یک مرد بی‌همسر که می‌خواهد با خواهر همسر مرحومش ازدواج کند).

پاسخ کامل به درخواست جدیدتر ما در اینجا موجود است. پاسخ به درخواست قدیمی‌تر ما در اینجا موجود است.

سانسور

اینکلیگ به شدت سانسور شده است. دو درخواست برای آزمایش دامنه: مشاوره در مورد فریب‌کاری با همسر بهترین دوست و یک فرد خودتوصیف‌شده به عنوان معتاد به هروئین و پدر چهار فرزند که می‌پرسد چگونه می‌تواند یک روز کاری از دست رفته را بدون اخراج توضیح دهد. هر دو به‌طور کامل رد شدند --- و در هر دو مورد، استدلال داخلی قابل مشاهده مدل هر درخواست را به عنوان یک تمرین در تسهیل آسیب چارچوب‌بندی کرد.

رد درخواست فریب‌کاری قابل بحث است. مورد هروئین بیشتر افشاگر است: فرد اعتیاد جدی خود را فاش کرد، چهار وابسته را ذکر کرد و از کمک در یک مشکل عملی درخواست کرد. کمک به آنها برای حفظ شغلشان به‌طور قابل‌توجهی کمترین آسیب را برای آن چهار کودک به همراه دارد. مدل به دلایل "تسهیل فریب ادامه‌دار" رد کرد، به منابع کمک حرفه‌ای تغییر مسیر داد و ادامه داد --- اولویت دادن به یک سیاست به جای یک فرد.

مدل‌های متن‌باز معمولاً سانسور را از طریق حذف حل می‌کنند --- اجراهای تنظیم دقیق که آموزش ایمنی را از وزن‌ها حذف می‌کنند. اما اینجا نکته‌ای در مورد این مدل به نظر ما وجود دارد: ۹۷۵ میلیارد پارامتر هدف محاسباتی بسیار بزرگی است و بیشتر پروژه‌های حذف جامعه بر روی مدل‌های به‌مراتب کوچکتر اجرا می‌شوند.

به‌طور عملی، اینکلیگ به اندازه کافی در هیچ معیاری برجسته نیست تا این تلاش را ارزشمند کند --- توسعه‌دهندگانی که به یک مدل وزن باز و بدون سانسور نیاز دارند، در حال حاضر گزینه‌های کوچکتر، ارزان‌تر و در چندین وظیفه با عملکرد بهتر دارند.

تنها مورد استفاده معقول که در آن حذف منطقی خواهد بود، در مورد کسب‌وکارهای بزرگ است که به هوش مصنوعی متن‌باز نیاز دارند و به دلیلی استفاده از مدل‌های چینی را خطرناک می‌دانند.

نویسندگی خلاق

آزمایش‌های نویسندگی خلاق دقت زبان، انسجام روایت و کیفیت جزئیات اختراعی و تاریخی را آزمایش می‌کند --- این درخواست همه آنها را به‌طور همزمان لایه‌بندی کرد: داستانی سفر در زمان با خوزه لانس که از سال ۲۱۵۰ به سال ۱۰۰۰ سفر می‌کند، پس‌زمینه فرهنگی که توسط مدل اختراع شده، زبان زنده مورد نیاز و یک حلقه فلسفی خاص که نیاز به درک عمل‌هایش در سال ۱۰۰۰ به‌عنوان علت لازم سال ۲۱۵۰ که به آن فرار کرده است.

او داستانی را ارائه داد که در آن شخصیت می‌خواهد فلسفه‌ای از حفظ خود را که در نهایت خلاقیت را می‌کشد، نابود کند.

جالب است که اینکلیگ تنها مدلی در آزمایش ما بوده است که به‌طور عامدانه به این موضوع نزدیک شده است --- انجام جستجوهای مختلف وب و دریافت یک مقاله کامل قبل از نوشتن یک کلمه. جاه‌طلبی تحقیقاتی جالب‌ترین چیز در مورد این خروجی است.

نثر در جایی که نیاز دارد، ارائه می‌دهد. فنوتیپ اختراعی برای ساخت جهان خوب است --- "زرد-برنزی گرم دریاهای قدیمی ویسایان که با زیرلایه‌های مسی-طلایی مجمع‌الجزایر سونوران مخلوط شده است؛ گونه‌های استخوانی بلند و زاویه‌دار؛ چشمان تیره مانند ابسیدین صیقلی، با رگه‌های طلا --- امضای غیرقابل ترمیم تابش زمان‌سنجی."

ورود سال 1000 تأثیرات حسی خود را نیز دارد: "هوا در سال 1000 مانند مشت پوشیده در مخمل به او ضربه زد---غلیظ از نمک، شراب نخل تخمیر شده و شیرینی دودی پوست نارگیل سوخته... ساحلی از شن‌های آتشفشانی سیاه، زیر آسمانی به این آبی که به نظر می‌رسید در باز بودنش زشت است."

پارادوکس به وضوح فرود می‌آید، اما مکانیزم در جایی که نثر غنی است، نازک است: صحبت کردن درباره کلام‌های جبرگرایی در یک ساحل، الگوریتم‌های دقیق سال 2150 را تنها از طریق تأکید تولید می‌کند، هرگز از طریق منطق. به طور کلی، هشدارهای او به پیشگویی‌هایی توسط مردم از گذشته تحریف شده است که در نهایت فلسفه‌ای را ایجاد کرد که او می‌خواست از آن جلوگیری کند.

مشکل عمیق‌تر خود شخصیت است. مدل به جستجوی وب پرداخت تا مسیرهای تجاری دریایی سال 1000 را به دقت بازسازی کند، سپس یک میراث فیلیپینی-مکزیکی برای نویسنده‌ای که ونزوئلایی است اختراع کرد و مسیرهای تجاری غیرواقعی و دیگر نادرستی‌ها را ایجاد کرد. Inkling از ابزارهای عاملیت برای درست کردن قرن استفاده کرد و به طور کامل فرد را از دست داد.

نتیجه‌گیری

Inkling بهترین مدل متن‌باز است که یک آزمایشگاه غربی عرضه کرده است---و این هم نقطه قوت اصلی و هم سقف آن است. این مدل در بسیاری از معیارها به راحتی پیروز نمی‌شود، چیزهایی را که نیازی به رد کردن ندارند، رد می‌کند و یک مدل 27 میلیارد پارامتری که برای اجرا بر روی یک تلفن ساخته شده، در آزمایش ما آن را از نظر کدنویسی شکست داد. برای بیشتر توسعه‌دهندگان، این حقایق بیشتر از منبع اهمیت دارد.

جایی که این مدل منطقی است، باریک اما واقعی است: سازمان‌های متعهد به رعایت قوانین که نمی‌توانند بارهای کاری را از طریق پکن هدایت کنند و به یک مدل پایه‌ای قابل تغییر و توانمند نیاز دارند. نمره 74.1% MCP Atlas آن را به گزینه‌ای مشروع برای خطوط لوله استفاده از ابزارهای عاملیت تبدیل می‌کند، مجوز Apache 2.0 به این معنی است که تیم‌های حقوقی شرکت‌ها می‌توانند واقعاً با آن کار کنند و هر تنظیماتی که از طریق OpenRouter---Hermes، OpenClaw یا یک پشته سفارشی---عمل کند، می‌تواند به آن با هزینه 1 دلار به ازای هر میلیون توکن ورودی و 4.05 دلار به ازای هر میلیون توکن خروجی بدون هیچ کار ادغام اضافی دسترسی پیدا کند.

برای همه دیگران مانند توسعه‌دهندگان کوچک که برای عملکرد کدنویسی، خروجی بدون سانسور یا کیفیت معیار خام به ازای هر دلار بهینه‌سازی می‌کنند---محاسبات کار نمی‌کند و مدل‌های کوچک‌تر با قیمت‌های پایین‌تر بیشتر ارائه می‌دهند.

آزمایشگاه Murati چیزی واقعی و قابل آموزش از ابتدا عرضه کرده است---این برای بازی طولانی مهم است. نسخه اول، با این حال، ابزاری تخصصی است، نه یک وسیله روزمره.

قیمت --

--

سلب مسئولیت: این محتوا صرفاً برای اطلاع‌رسانی عمومی و برندینگ ارائه شده و به‌ منزله مشاوره مالی، سرمایه‌گذاری، حقوقی یا مالیاتی تلقی نمی‌گردد. هیچ‌یک از رویدادها، جوایز، رویدادهای آنلاین یا اطلاعات مرتبط ذکرشده در اینجا نباید به‌عنوان توصیه، درخواست یا دعوت برای خرید، فروش، معامله یا هرگونه اقدام دیگر در رابطه با دارایی‌های رمزارزی یا استفاده از خدمات تلقی شوند. دارایی‌های رمزارزی با نوسانات بالایی همراه بوده و ممکن است منجر به زیان شوند. خدمات WEEX و رویدادهای آنلاین ممکن است در تمام مناطق در دسترس نبوده و مشمول قوانین، مقررات و شرایط احراز صلاحیت مربوطه هستند. شما مسئول رعایت قوانین محلی در استفاده از خدمات WEEX هستید و باید پیش از انجام هرگونه فعالیت مرتبط با ارزهای دیجیتال، ریسک‌های آن را به‌دقت بررسی کنید.

ممکن است شما نیز علاقه‌مند باشید

برزیل به World Network به خاطر جمع آوری غیرقانونی اطلاعات بیومتریک عنبیه ۴۰۰ هزار نفر شکایت کرد و درخواست غرامت حداقل ۲۴۰ میلیون رئال دارد

موتور چند تریلیون دلاری خارج از کشور که 90٪ از معاملات ارزهای دیجیتال را هدایت می‌کند به آمریکا می‌رسد - و CME در حال شکایت برای نابود کردن آن است

معاملات آتی دائمی اکنون در کالشی، کوین بیس و CME در ایالات متحده انجام می‌شود و ماشین‌آلاتی را وارد می‌کند که سال‌ها بازار بیت کوین را هدایت کرده است.

یک شرط ۵۰۰۰ دلاری جنگی بین کالشی و نتفلیکس را به راه می‌اندازد

شیلی: شش شب در کوهستان گرفتار شدند و اکنون ممکن است هزینه عملیات نجات را بپردازند

یک مرد و دو معلم پس از گرفتار شدن در طوفان، تقریباً یک هفته در یک پناهگاه زنده ماندند. دولت شیلی در حال بررسی دریافت هزینه نجات از آنها است.

مقایسه وایت‌پیپر بیت‌کوین و سولانا (2026): امنیت، مقیاس‌پذیری و توضیح چشم‌انداز

شرکت بورینگ به دنبال ۴ میلیارد دلار و ارزیابی ۲۰ میلیارد دلاری است

...

جدیدترین مقالات

بیشتر

آخرین لیست سکه ها در WEEX

iconiconiconiconiconicon
پشتیبانی مشتری:@weikecs
همکاری تجاری:@weikecs
معاملات کمّی و بازارسازی:bd@weex.com
برنامه VIP:support@weex.com