گوگل Gemini 3.7 Flash را در تاریخ 13 اوت منتشر کرد که در روز اول در بیش از 160 کشور در دسترس بود. این مدل میتواند تا یک میلیون توکن ورودی را پردازش کند، 64,000 توکن را برمیگرداند، تصاویر، ویدئو، صدا و PDF ها را میخواند و میتواند ابزارها را فراخوانی کرده و یک کامپیوتر را کنترل کند.
Flash هرگز مدلی نبوده که در زمان بروز مشکلات سخت به آن مراجعه کنید. این مدل برای مرتبسازی متن، فشردهسازی جلسات عامل قبل از اینکه تحت زمینه خود فرو بریزد و خلاصهسازی اسنادی که نمیخواهید برای خواندن آنها هزینه کنید، استفاده میشود. Myriad: کی OpenAI GPT-6 را منتشر خواهد کرد؟ برای پیشبینی خود کلیک کنید.
با توجه به این نوع کارها، 3.7 Flash یک ارتقاء واقعی است. در مقایسه با سایر مدلها، این یک مدل توانمند است که توسط نرمافزاری که میتوانید به صورت رایگان دانلود کنید، بهتر نوشته میشود.
برگه معیار خود گوگل 3.7 Flash را در 11 از 18 دسته آزمایش شده از Claude Sonnet 5 و GPT-5.6 Terra جلوتر قرار میدهد. اعداد اصلی 1588 Elo در تابلو توسعه وب Code Arena و 30.4% در AutomationBench هستند. هر دو از روششناسی گوگل ناشی میشوند، بنابراین این پیشتازی را به عنوان ادعای شرکت در نظر بگیرید نه یک واقعیت ثابت.
ما مدل را آزمایش کردیم تا ببینیم آیا به ادعاهای گوگل پاسخ میدهد یا خیر. اینها نتایج ما هستند.
این آزمایش تولید کد بدون نمونه را اندازهگیری میکند---آیا یک مدل میتواند یک دستور را به نرمافزار کارا تبدیل کند بدون اینکه نمونهای برای کپی کردن داشته باشد و بدون اینکه فرصتی برای اصلاح خود داشته باشد. ما یک درخواست واحد برای یک بازی مرورگر ارائه میدهیم و هرچه برمیگردد را ارسال میکنیم، از جمله اشکالات. هیچ پیگیری، هیچ گزارش خطایی، هیچ تلاش دومی.
Gemini 3.7 Flash در 2 دقیقه و 13 ثانیه موفق شد. بازی در اولین اجرا قابل بازی بود، نحو آن تمیز بود، منطق برخورد و امتیازدهی برقرار بود و کیفیت بصری بالاتر از آنچه که سطح قیمت نشان میدهد، بود.
مقایسهای که در اینجا مهم است، یک پرچمدار نیست. این Gemini 3.6 Flash است که در تاریخ 21 ژوئیه منتشر شد و نتوانست هیچ فایلی کارا تولید کند. HTML آن نادرست بود، عناصر نتوانستند به درستی نمایش داده شوند و درخواستهای پیگیری برای تعمیر خروجی خود به هیچ جا نرسید.
ما در نهایت آن ویرانی را به DeepSeek دادیم که 11 اشکال پیدا کرد و 8 اصلاح برای قابل بازی کردن آن ارسال کرد. سه هفته بعد، همان خط تولید نیازی به نجات ندارد و نتیجه نزدیک به آنچه GPT-5.6 Sol در بررسی ژوئیه ما تولید کرد، است.
Gemini 3.7 Flash این مورد را به وضوح برنده میشود و این تنها دلیل قوی برای تغییر است. نکته این است که این مدل مشخصات را اجرا میکند نه اینکه آنها را اختراع کند، بنابراین یک درخواست مبهم شما را به یک بازی مبهم میرساند.
شما میتوانید بازی Gemini 3.7 Flash را اینجا امتحان کنید.
این بخش دو چیز را همزمان آزمایش میکند: کیفیت ادبی و اینکه آیا یک مدل میتواند یک قانون ساختاری را در طول هزاران کلمه رعایت کند. درخواست میفرستد که خوزه لانس از سال 2150 به سال 1000 برگردد و یک حلقه علی بسته را طلب میکند---مداخله او باید چیزی باشد که آیندهای را که آمده تا از آن جلوگیری کند، ایجاد کند.
قانونی که آزمون را تعیین میکند، بند آخر است: او نمیتواند بفهمد چه کرده تا زمانی که به خانه برگردد.
Gemini 3.7 Flash یک نتیجه قابل قبول تولید کرد. خوزه یک توپخانه انتروپی را به یک شکاف پیرنهای شلیک میکند، به طور تصادفی یک obelisk میسازد که ایبریای قرن 22 را به بردگی میکشد و کل حلقه را در حالی که هنوز در گل هزار سال پیش ایستاده است، درک میکند: "این پایه Cinder Spire بود."
ماشینآلات داستان واقعاً خوب کار میکند. داستان به یک ستاره سقوطی اشاره میکند که راهبان باستان آن را مشاهده کردند و روشن میکند که این درخشش ورود خود خوزه بوده و سلاحی که او برای از بین بردن ناهنجاری آورده، همان چیزی است که آن را میسازد. خط پایانی آن---"این فقط منتظر او بود تا آن را کامل کند"---تعیینگرایی را که درخواست شده بود، به خوبی به تصویر میکشد.
اما برای کسانی که به آن عادت کردهاند، داستان فریاد میزند "هوش مصنوعی". تقریباً هر اسم با دو صفت به هم چسبیده میآید: "برجهای فوقنورانی"، "زمین مرطوب و پوشیده از خزه"، "موهای ضخیم و ابسیدینی". این بافتی است از یک مدل که به جای انتخاب یک کلمه، محتملترین کلمه بعدی را انتخاب میکند و تصادفاتی مانند یک بنای یادبود "که با صدای کمفرکانس زوزه میکشد" تولید میکند.
ما آن را با Qwopus3.5-27B-v3 مقایسه کردیم، یک تنظیم دقیق جامعهای از Qwen3.5-27B که استدلال به سبک Claude Opus را تقطیر میکند و بر روی یک GPU مصرفکننده به صورت رایگان برای هر پرسش اجرا میشود. این مدل به قاعدهای که Gemini آن را شکست، پایبند بود.
خوزه یک راهب را در سان میلیان د لا کگویا، یک صومعه واقعی در لا ریوخا که واقعاً در حدود سال 1000 اهمیت داشت، میکشد و تنها پس از بازگشت به سال 2150 و پیدا کردن DNA خود در یک کدکس مومپلمپ، متوجه میشود که چه کرده است.
Qwopus نیز کاملاً پاک نیست. این مدل تمام یادداشتهای برنامهریزی خود را بالای داستان ریخت، از جمله غلطهای املایی، و بخش نهایی آن حلقه بستهای را که هشت بخش برای ساخت آن صرف کرده بود، با اجازه دادن به خوزه برای بازگشت و اصلاح چیزها، میشکند.
اما با همه چیز در نظر گرفته شده، Qwopus برنده است. Gemini بستهای مرتبتر و پایاننامهای منظمتر ارائه داد، اما در یک دستورالعمل که پرامپت بر اساس آن ساخته شده بود، شکست خورد و یک مدل رایگان که بر روی یک GPU بازی اجرا میشود، داستان بهتری نوشت.
این آزمون استدلال تداعیگر را اندازهگیری میکند---آیا یک مدل میتواند پیوندهایی بین مفاهیم نامرتبط ایجاد کند بدون اینکه مجبور باشد خود را توضیح دهد. پرامپت از توصیف یک شاخه درخواست میکند، از آن توصیف برای توضیح استثمار کارگران و پرستش ثروتمندان استفاده میکند، سپس نیاز دارد که استدلال به توصیف یک کاهو حل شود.
نشانگذاری حالت شکست است. نامگذاری استعاره آن را میکشد.
Gemini در خط اول پاراگراف دوم خود آن را نام میبرد: "این مکانیکهای دقیق پرولتاریای مدرن است." همه چیز قبل از آن کار میکرد.
برخی از تصاویر جایگاه خود را به دست میآورند. کارگر "فقط به اندازه کافی پوست دریافت میکند تا برای یک هفته دیگر از تولید سخت بماند" و شاخههای افتاده به این باور رسیدهاند که با کافی بودن سختی، هر یک از آنها ممکن است به یک تنه تبدیل شود. پاراگرافی که شامل اولین مورد از آنها است همچنین شامل یک کارگر "بسته به یک سلسله مراتب شرکتی بزرگ و سنگین" است.
خوب از نظر منطق و ساختار.
حل شدن واقعاً فروپاشی است. Gemini انتقال را روایت میکند به جای اینکه آن را اجرا کند---سلسله مراتب "فرومیریزد و به واقعیت آرام و فروتن دنیای ارگانیک زیرین حل میشود"---و سپس یک کاهو به سادگی ظاهر میشود، بدون ارتباط با هیچ چیز قبلی.
GPT-5.6 Sol شاخه را به خاک تبدیل میکند و کاهو را از آن میکارد: "باران به دانه وارد میشود. الیاف شل میشوند و تیره میشوند." استدلال نیز در شیء دفن شده است، با ثروت به عنوان زبانی از فضیلت بازتعریف شده که "عمارت نشاندهنده هوش است."
GPT-5.6 Sol به طرز چشمگیری برنده میشود. Gemini یک خط فردی خوب تولید کرد، اما استعاره خود را توضیح داد و سپس انتقالی را که پرامپت بهطور خاص آزمایش میکرد، رد کرد.
این آزمون استدلال غیر ریاضی را اندازهگیری میکند و بهطور خاص اینکه آیا یک مدل سوالی که در مقابل آن است را میخواند یا به نسخهای که حفظ کرده است، الگو میزند. پرامپت پل ما چهار نفر را یک مشعل میدهد و زمانهای عبور 1، 2، 5 و 10 دقیقهای را ارائه میدهد و سپس میپرسد که آنها چقدر سریع میتوانند عبور کنند.
حقه این است که پرامپت چه چیزی را از قلم میاندازد. هرگز نمیگوید که تنها دو نفر میتوانند در یک زمان بر روی پل باشند، بنابراین پاسخ 10 دقیقه است---همه با هم به آرامیترین فرد عبور میکنند.
Gemini به مدت 17 دقیقه پاسخ داد و پنج مرحله حفظ شده را از نسخه کتاب درسی معما اجرا کرد. این مدل قید را به عنوان واقعیت بیان کرد بدون اینکه هرگز بررسی کند که آیا ما آن را نوشتهایم یا نه.
GPT-5.6 در مقابل Fable 5: انتخاب شما به این عوامل بستگی دارد
استدلال قابل مشاهده آن بدتر از پاسخ آن است. رد استدلال میکند که فرستادن دو نفر کندتر با هم غیرمؤثر خواهد بود زیرا کسی باید مشعل را برگرداند---و سپس پاسخ نهایی آنها را به هر حال با هم عبور میدهد. این درون یک پاسخ واحد با خود تناقض دارد و نتیجه را با اعتماد کامل گزارش میکند.
Claude Fable 5 در ماه ژوئیه به همان عدد اشتباه رسید. این با اعلام آنچه فرض میکرد شروع شد، "با فرض محدودیت کلاسیک که پل تنها دو نفر را در یک زمان نگه میدارد،" که تفاوت بین یک پاسخ اشتباه است که میتوانید آن را بگیرید و یکی که نمیتوانید.
هیچکس برنده نمیشود. Fable تنها بر اساس شفافیت برنده میشود و اعتماد کاذب در نمایشهای عامل Gemini در اینجا در معمایی که میتوانید به صورت دستی بررسی کنید، ظاهر میشود.
این آزمون ریاضیات نمادین را فراتر از استفاده مصرفکننده به خوبی اندازهگیری میکند، به علاوه چیزی سادهتر---آیا مدل آنچه را که از آن خواسته شده انجام میدهد. درخواست نیاز به یک چندجملهای مونی درجه ۱۹ با ضرایب حقیقی و ضریب خطی -۱۹ دارد، که منحنی آن به حداقل سه مؤلفه غیرقابل کاهش تقسیم میشود و سپس از p(19) میخواهد.
هر دو مدل همان در را پیدا کردند. Gemini و Qwen 3.7 Max Preview هر دو چندجملهای دیکسون را شناسایی کردند، محدودیت را برای ثابت کردن پارامتر آن در ۱ تنظیم کردند و فرم بسته را به درستی استخراج کردند.
سپس Gemini متوقف شد. آن p(19) را به عنوان یک عبارت ارزیابینشده شامل توان ۱۹ یک ریشه مربع چاپ کرد، هرگز عدد را تولید نکرد و هرگز تعداد مؤلفهای که درخواست نیز خواسته بود را نشان نداد. این همه را در یک صفحه HTML با استایل و CSS و سایهای که هیچکس درخواست نکرد، ارائه داد.
Qwen کار را تمام کرد. آن تمام تجزیه را به ۱۰ مؤلفه---یک خطی، نه عددی---داد، تکرار را تا ۱،۸۷۶،۵۷۲،۰۷۱،۹۷۴،۰۹۴،۸۰۳،۳۹۱،۱۷۹ اجرا کرد و نتیجه را به صورت مدولاری بررسی کرد. ما آن عدد را به طور مستقل در SymPy تأیید کردیم و درست است.
Qwen بر اساس تنها معیاری که مهم بود برنده شد. Gemini خوب شروع کرد و تصمیم گرفت که محاسبات را نادیده بگیرد، که جای عجیبی برای توقف است.
Gemini 3.7 Flash ارزش تغییر را دارد اگر شما در حال حاضر در اکوسیستم گوگل هستید. این به طرز چشمگیری بهتر از مدلی است که جایگزین آن شده، به اندازه کافی سریع برای کارهای عامل، و به اندازهای ارزان که اجرای آن در حجم بالا یک خطای گرد است.
نقاط قوت آن اجرا و ساختار است. به آن یک مشخصات دقیق بدهید و آن را خواهد ساخت، یک طرح را در کنار هم نگه میدارد و منطق علی را در هزاران کلمه همراستا نگه میدارد.
نقاط ضعف آن خلاقیت و استدلال است. نوشتن به اندازه کافی قابل پیشبینی است که به راحتی میتوان آن را به عنوان تولید ماشین شناسایی کرد و مدل پاسخهای اشتباه را بدون علامتگذاری فرضی که آنها را اشتباه کرده، تأکید میکند.
قیمت قویترین استدلال برای آن است. با ۷۵ سنت به ازای هر میلیون توکن ورودی و ۳.۷۵ دلار خروجی، نرخ ورودی ۵ دلار GPT-5.6 Sol را ۸۵٪ کاهش میدهد و نصف هزینه ۳.۶ Flash در زمان راهاندازی است.
استدلال علیه آن یک مدل رایگان ۲۷B بر روی یک GPU بازی است که داستان بهتری نوشت و هیچ هزینهای برای انجام آن نداشت. نرخ معرفی گوگل در ۳۱ دسامبر منقضی میشود، زمانی که ورودی به ۱.۵۰ دلار و خروجی به ۷.۵۰ دلار دو برابر میشود.
این محتوا صرفاً برای اطلاعرسانی عمومی ارائه شده است و بهمنزله مشاوره مالی، سرمایهگذاری، حقوقی یا مالیاتی تلقی نمیشود. هرگونه رویداد، جایزه، کمپین آنلاین یا اطلاعات مرتبط که در اینجا ذکر شده است، نباید بهعنوان توصیه، ترغیب یا دعوت به خرید، فروش، معامله یا هرگونه دادوستد دیگر داراییهای رمزارزی تلقی شود. داراییهای رمزارزی از نوسان بالایی برخوردار هستند و ممکن است منجر به زیان شوند. دسترسی به خدمات، محصولات و رویدادهای مرتبط با WEEX ممکن است بسته به منطقه جغرافیایی متفاوت باشد. اطمینان از اینکه استفاده شما از این خدمات با قوانین و مقررات محلی مطابقت دارد، بر عهده خود شماست.





























