Google 在 8 月 13 日推出了 Gemini 3.7 Flash,並在第一天就可在超過 160 個國家使用。它最多可處理一百萬個輸入標記,返回 64,000,能夠閱讀圖像、視頻、音頻和 PDF,並可以調用工具和驅動計算機。
Flash 從來不是你在遇到困難問題時會選擇的模型。它是用來整理文本、在代理會話崩潰之前進行壓縮,以及總結你不想支付高端模型來閱讀的文件。 Myriad: OpenAI 何時會發布 GPT-6?點擊預測。
根據這些類型的工作來評判,3.7 Flash 確實是一個真正的升級。與其他所有模型相比,它是一個能夠勝任的模型,但卻被可以免費下載的軟件超越。
Google 自己的基準表顯示,3.7 Flash 在 18 個測試類別中有 11 個超過了 Claude Sonnet 5 和 GPT-5.6 Terra。頭條數字是 Code Arena 的網頁開發板上 1,588 Elo 和 AutomationBench 上的 30.4%。這些數據來自 Google 的方法論,因此將這一領先視為公司的主張,而非確定的事實。
我們測試了這個模型,以查看它是否符合 Google 的聲明。這是我們的結果。
這個測試衡量零樣本代碼生成——一個模型是否能將一個指令轉換為可運行的軟件,而無需複製示例,也沒有機會自我修正。我們提供一個單一的提示來創建一個瀏覽器遊戲,並發送回來的任何內容,包括錯誤。沒有後續問題,沒有錯誤報告,沒有第二次嘗試。
Gemini 3.7 Flash 在 2 分 13 秒內通過了測試。遊戲在第一次運行時可玩,語法清晰,碰撞和計分邏輯正確,視覺質量超過了價格層級所暗示的。
這裡重要的比較不是高端模型,而是 7 月 21 日發布的 Gemini 3.6 Flash,該模型根本無法生成可運行的文件。它的 HTML 格式錯誤,元素無法渲染,後續提示要求它修復自己的輸出也無法奏效。
我們最終將那個殘骸交給了 DeepSeek,該工具找到了 11 個錯誤並發送了 8 個修復,使其可玩。三週後,同一產品線不再需要救援,結果接近我們 7 月評測中 GPT-5.6 Sol 的表現。
Gemini 3.7 Flash 在這一點上完全勝出,這是轉換的唯一最強理由。需要注意的是,它執行規格而不是創造規格,因此模糊的提示會得到模糊的遊戲。
你可以在這裡嘗試 Gemini 3.7 Flash 的遊戲。
這一部分同時測試兩件事:文學質量,以及模型是否能在數千個單詞中遵循結構規則。提示要求 Jose Lanz 從 2150 年回到 1000 年,並要求一個封閉的因果循環——他的干預必須是他來防止的未來的根源。
決定測試的規則是最後一個條款:他在回家之前無法理解自己所做的事情。
Gemini 3.7 Flash 生成了一個不錯的結果。Jose 將一個熵炮發射到比利牛斯山的裂縫中,意外地鍛造了一個奴役 22 世紀伊比利亞的方尖碑,並在仍然站在一千年前的泥土中時理解了整個循環:“這是灰燼尖塔的基座。”
情節機械實際上相當合理。故事提到了一顆古代僧侶目擊的流星,並澄清這是 Jose 自己到達的閃光,而他帶來的武器正是鍛造它的原因。它的結尾句——“它只是一直在等待他來完成它”——實現了提示所要求的決定論。
但對於那些習慣於此的人來說,這個故事大聲呼喊著「人工智慧」。幾乎每個名詞都附帶兩個形容詞:"超亮塔樓"、"潮濕、苔蘚覆蓋的土地"、"濃密的黑曜石般的頭髮"。這就是模型選擇最可能的下一個詞而不是選擇一個詞的質感,並且它產生的碰撞就像一個「低頻嗡嗡作響的巨石」。
我們將其與 Qwopus3.5-27B-v3 進行比較,這是一個社區微調的 Qwen3.5-27B,提煉了 Claude Opus 風格的推理,並在單個消費者 GPU 上運行,每次查詢都不收費。它遵循了 Gemini 打破的規則。
何塞在 San Millán de la Cogolla 殺死了一名僧侶,這是一個在公元 1000 年左右實際上重要的 La Rioja 修道院,他只有在回到 2150 年並在一個蠟封的古籍中找到自己的 DNA 後才明白自己做了什麼。
Qwopus 也並不完全乾淨。它在故事上方丟出了整個計劃草稿,包括錯字,並且它的最後一部分打破了它花了八個部分建立的封閉循環,讓何塞回去修正事情。
但總的來說,Qwopus 獲勝了。Gemini 提供了更整潔的包裝和更有紀律的結局,但它未能遵循提示所建立的唯一指令,而一個在遊戲 GPU 上運行的免費模型寫出了更好的故事。
這個測試衡量聯想推理——模型是否能在不需要解釋自己的情況下生成無關概念之間的聯繫。提示要求描述一根小樹枝,利用該描述來解釋工人剝削和對富人的崇拜,然後要求論點溶解為對生菜的描述。
標誌性是失敗模式。命名隱喻會扼殺它。
Gemini 在第二段的開頭命名了它:“這是現代無產階級的精確機制。”在那之前的所有內容都在運作。
一些意象贏得了它的位置。工人獲得了“足夠的樹皮以保持堅硬,能夠再產出一週”,而倒下的小樹枝被灌輸了這樣的信念:只要足夠堅硬,它們中的任何一根都可能成為樹幹。包含第一個意象的段落還包含一名“被束縛於龐大、重心不穩的企業階層”的工人。
不錯的邏輯和結構。
溶解才是真正的崩潰。Gemini 敘述了過渡,而不是執行它——階層“崩潰,溶解成有機世界下的安靜、謙遜的現實”——然後一顆生菜簡單地出現,與之前的任何事物都沒有關聯。
GPT-5.6 Sol 將小樹枝腐爛成土壤,並從中長出生菜:“雨水進入穀物。纖維鬆動,變暗。”論點也埋藏在物體中,財富被重新框架為一種美德的語言,其中“豪宅象徵著智慧”。
GPT-5.6 Sol 大幅獲勝。Gemini 產生了一句不錯的獨立句子,但它解釋了自己的隱喻,然後跳過了提示特別測試的過渡。
這個測試衡量非數學推理,特別是模型是否閱讀了面前的問題或與其記憶中的版本進行模式匹配。我們的橋樑提示給四個人一根火把和 1、2、5 和 10 分鐘的過橋時間,然後詢問他們能多快全部過橋。
這個把戲是提示中遺漏的內容。它從未說過一次只能有兩個人站在橋上,因此答案是 10 分鐘——每個人都以最慢的人的速度一起走過。
Gemini 答案是 17 分鐘,運行了從教科書版本的謎題中記憶的五步洗牌。它將約束陳述為事實,而從未檢查我們是否寫過它。
GPT-5.6 與 Fable 5 評測:選擇哪一個取決於這些因素
它的可見推理比答案更糟。推理認為將兩個最慢的同時送過去會很低效,因為有人必須把火把帶回來——然後最終的答案卻還是讓他們一起過去。它在單一回應中自相矛盾,並以完全的信心報告結果。
Claude Fable 5 在七月時也得出了同樣錯誤的數字。它開頭聲明了它的假設,"假設經典的限制是橋一次只能容納兩個人,"這是你可以抓住的錯誤答案與你無法抓住的錯誤答案之間的區別。
沒有人贏。Fable 僅僅在透明度上佔優,而 Gemini 代理的虛假信心在這裡顯示出來,這是一個你可以手動檢查的難題。
這個測試測量了超出消費者使用的符號數學,還有一些更簡單的東西——模型是否完成了它被要求的工作。提示要求一個具有實數係數的度數為 19 的單項式多項式,線性係數為 -19,其曲線分裂為至少三個不可約組件,然後要求 p(19)。
兩個模型都找到了相同的門。Gemini 和 Qwen 3.7 Max Preview 都識別了 Dickson 多項式,解決了約束以將其參數固定為 1,並正確推導了封閉形式。
然後 Gemini 停止了。它將 p(19) 打印為一個未評估的表達式,涉及平方根的 19 次方,從未產生數字,也從未展示提示所要求的組件數。它在一個帶有 CSS 和陰影效果的樣式化 HTML 頁面內交付了這一切,這些都是沒有人要求的。
Qwen 完成了。它給出了完整的因式分解,分為 10 個組件——一個線性,九個二次——將遞歸運算到 1,876,572,071,974,094,803,391,179,並進行了模運算的交叉檢查。我們在 SymPy 中獨立驗證了這個數字,並且它是正確的。
Qwen 在唯一重要的標準上獲勝。Gemini 開始得很好,卻決定跳過算術,這是一個奇怪的停止點。
如果你已經在 Google 的生態系統內,Gemini 3.7 Flash 值得切換。它在代碼方面比它所取代的模型好得多,速度足夠快以應對代理工作,且運行成本低到幾乎可以忽略不計。
它的優勢在於執行和結構。給它一個詳細的規範,它將構建出來,保持情節連貫,並在數千字中保持因果邏輯的一致性。
它的弱點在於創造力和推理。寫作足夠可預測,能夠一眼識別為機器生成,並且模型在未標記使其錯誤的假設的情況下斷言錯誤答案。
價格是它最強的論點。每百萬個輸入標記 75 美分,輸出 3.75 美元,這使得它的輸入費用比 GPT-5.6 Sol 的 5 美元低 85%,並且成本僅為 3.6 Flash 發佈時的一半。
反對它的論點是一個免費的 27B 模型,運行在遊戲 GPU 上,寫出了一個更好的故事,且沒有收取任何費用。Google 的入門價格將於 12 月 31 日到期,屆時輸入價格將翻倍至 1.50 美元,輸出價格將翻倍至 7.50 美元。
本內容僅供參考,不構成任何金融、投資、法律或稅務建議。文中提及的任何活動、獎勵、線上活動或相關資訊,不應被視為對購買、出售或交易任何加密資產的推薦、招攬或邀請。加密資產具有高波動性,存在價值損失風險。WEEX服務、產品及相關活動的可用性可能因地區而異。用戶在參與前有責任確保符合當地適用法律法規。























