Qwen3.7-Max 完全評測:阿里巴巴最強 AI 模型,全球排名第 5

Qwen3.7-Max 完全評測:阿里巴巴最強 AI 模型,全球排名第 5

什麼是 Qwen3.7-Max?

Qwen3.7-Max 是阿里巴巴集團於 2026 年 6 月最新發佈的旗艦級大語言模型,也是通義千問(Qwen)系列迄今為止效能最強的閉源模型。在 Artificial Analysis Intelligence Index v4.0 的權威評測中,Qwen3.7-Max 以推理模式 56.6 分成績位列全球第 5-7 名,成為排名最高的中文大語言模型,也被國際 AI 分析媒體 The Batch 稱為”挑戰 Google 第三名的有力競爭者”。

與 FreeAITool 此前介紹過的 Qwen3 Coder(#035) 不同——那是一款面向程式碼生成的開源模型——Qwen3.7-Max 定位為通用旗艦模型,參數規模和訓練方法均未公開。這一變化標誌著阿里巴巴正在延續行業趨勢,從開源策略逐步轉向閉源商業化營運。

阿里巴巴最新旗艦模型

Qwen3.7-Max 的關鍵規格如下:

規格參數
輸入上限100 萬 tokens
輸出上限64,000 tokens
生成速度208.3 tokens/sec(全球第 3)
幻覺率23%(前沿模型中最低)
推理模式支援(增強數學、邏輯推理能力)
工具呼叫支援
Prompt 快取支援
API 相容OpenAI API、Anthropic API

為什麼從開源轉向閉源?

阿里巴巴的 Qwen 系列一直是開源社群的重要貢獻者。從 Qwen、Qwen1.5、Qwen2、Qwen2.5 到 Qwen3 Coder,開源路線幫助阿里建立了強大的開發者生態和品牌認知。然而,Qwen3.7-Max 以及同期的 Qwen3.6-Max-Preview、Qwen3.6-Plus 均為閉源模型。

這一轉變背後的原因不難理解:

  • 模型能力已接近或超越開源模型的「甜點區」:當模型參數量達到數百億甚至上千億級別時,開源的成本(算力、頻寬、合規風險)顯著上升,而閉源可以透過 API 計費實現更好的商業化回報
  • API 定價極具競爭力:Qwen3.7-Max 的輸入價格為 $2.50 / 百萬 tokens,遠低於 GPT-4o 的 $2.50-5.00 和 Claude Sonnet 的 $3.00,這讓閉源模式同樣具有市場吸引力
  • 保護核心技術機密:訓練方法中採用的「解耦式強化學習」等創新技術是阿里巴巴的核心競爭力,不公開參數有助於保持競爭優勢

如果你更關注開源模型,我們此前的 AI Leaderboard 排名文章(#033) 提供了更全面的開源模型橫向對比。

Qwen3.7-Max 定價與成本分析

Qwen3.7-Max 以高性價比著稱,是 GPT-5 的有力替代品:

官方定價(阿里雲百煉平臺):

  • 輸入: ¥0.004/千 token(約 $0.55/百萬 token)
  • 輸出: ¥0.012/千 token(約 $1.65/百萬 token)
  • 新使用者: 100 萬 token 免費額度

與競品對比:

  • vs GPT-5: 價格低 67%,中文任務表現更好
  • vs Claude Sonnet 4: 價格低 50%,長上下文支援更強(128K vs 100K)
  • vs Gemini 2.0: 價格相當,中文最佳化更優

最佳使用場景: 中文內容生成、長文件分析、成本敏感的批次任務。

省錢技巧: 批次購買 token 包可享 8 折優惠,年付企業使用者可談至 7 折。

效能評測:全球排名第 5

Artificial Analysis Intelligence Index 排名

Artificial Analysis 是全球最權威的 AI 模型評測平臺之一,其 Intelligence Index v4.0 綜合考量模型在推理、編碼、指令跟隨、多語言等多個維度的表現。Qwen3.7-Max 在該評測中取得以下成績:

  • 推理模式綜合得分:56.6 分
  • 全球排名:第 5-7 名(取決於其他模型是否啟用推理模式)
  • 中文模型排名:第 1 名

這一排名意味著 Qwen3.7-Max 已經超越了 Google 的部分旗艦模型(如 Gemini 3.5 Flash),正在逼近 Claude Sonnet 4.6 和 GPT-4.1 等頂級模型的水平。對於一款中國公司開發的模型來說,這一成績具有里程碑意義。

📌 來源:The Batch #357 詳細報導Artificial Analysis Qwen3.7 Max 分析頁

速度:全球第 3(208 tokens/sec)

在生成速度方面,Qwen3.7-Max 以 208.3 tokens/sec 的成績位列全球第 3,僅次於 GPT-OSS 120B(313 tokens/sec)和 GPT-OSS 20B(238 tokens/sec)。

速度對於實際應用至關重要:

  • 實時對話體驗更流暢:208 tokens/sec 意味著每秒可以生成約 150-160 箇中文字元,使用者幾乎感覺不到延遲
  • 批次處理更高效:對於需要大量生成內容的場景(如批次翻譯、文件摘要),速度優勢直接轉化為時間成本節省
  • API 呼叫成本更低:更快的生成速度意味著在相同的 API 超時時間內可以完成更多任務

幻覺率:前沿模型最低(23%)

幻覺(Hallucination)是大語言模型生成不實資訊的現象,也是當前 AI 應用面臨的最大挑戰之一。Qwen3.7-Max 的幻覺率僅為 23%,在所有前沿模型中最低。

這意味著什麼?假設你讓模型回答一個專業問題:

  • 如果其他前沿模型的幻覺率約為 30-40%,那麼每 10 個回答中可能有 3-4 個包含不準確資訊
  • 而 Qwen3.7-Max 每 10 個回答中只有約 2-3 個可能不準確

對於需要高可靠性的場景(如醫療諮詢、法律輔助、金融分析),低幻覺率是選擇模型的重要考量因素。

與 Gemini 3.5 Flash、Claude Sonnet 4.6 對比

維度Qwen3.7-MaxGemini 3.5 FlashClaude Sonnet 4.6
Intelligence Index56.6~55~58
速度(tokens/sec)208~180~150
幻覺率23%~30%~28%
輸入上限100 萬 tokens100 萬 tokens20 萬 tokens
API 輸入價格$2.50/M tokens$1.25/M tokens$3.00/M tokens
上下文保留跨輪次保留推理文字部分支援支援

綜合來看,Qwen3.7-Max 在速度和幻覺率方面具有明顯優勢,在綜合智力排名上接近 Claude Sonnet 4.6 但略低。如果你的應用場景對生成速度和準確性要求較高,Qwen3.7-Max 是一個非常值得考慮的選項。

核心功能

100 萬 token 上下文視窗

Qwen3.7-Max 支援高達 100 萬 tokens 的上下文輸入,這意味著你可以:

  • 上傳整本書籍進行分析:一本 20 萬字的中文小說約需 40-50 萬 tokens,Qwen3.7-Max 可以一次性處理
  • 分析大型程式碼庫:包含數百個檔案的程式碼專案可以被完整輸入,模型能夠理解全域性架構
  • 處理超長會議記錄:數小時的會議逐字稿可以直接交給模型生成摘要和待辦事項

在實際使用中,建議將上下文控制在 50 萬 tokens 以內,以獲得最佳的響應速度和準確率。超過此閾值後,模型對上下文早期部分資訊的關注度可能會降低。

推理模式與工具呼叫

Qwen3.7-Max 的推理模式(Reasoning Mode)顯著增強了模型在數學計算、邏輯推理和複雜問題分析方面的能力。開啟推理模式後,模型會在回答前進行多步驟的思考過程,類似於人類的”先思考再回答”。

此外,模型支援工具呼叫(Tool Calling)功能,可以在對話中自動呼叫外部 API、搜尋引擎、資料庫等工具,獲取實時資訊後再給出答案。這在以下場景中尤為實用:

  • 實時資訊查詢:當使用者詢問當前天氣、股票價格等需要最新資料的問時,模型可以自動呼叫搜尋工具
  • 程式碼執行:結合程式碼執行環境,模型可以編寫並執行程式碼來驗證答案
  • 多步任務分解:將複雜任務拆分為多個子任務,依次呼叫不同工具完成

Prompt 快取加速

Qwen3.7-Max 支援 Prompt 快取功能,對於重複使用的系統提示詞或長上下文,可以透過快取機制顯著降低成本和延遲:

  • 快取命中價格:僅 $0.25 / 百萬 tokens(正常價格的 1/10)
  • 適用場景:固定的系統提示詞、反覆使用的知識庫文件、批次處理相同模板的資料
  • 加速效果:快取命中的請求響應速度通常比非快取請求快 2-3 倍

如果你的應用場景涉及大量重複性請求(如客服機器人、批次文件處理),善用 Prompt 快取可以大幅降低 API 成本。

跨輪次保留推理文字

在啟用推理模式的多輪對話中,Qwen3.7-Max 會保留每一輪的推理過程文字,而非僅保留最終回答。這使得模型在後續對話中能夠:

  • 延續之前的思考路徑:如果使用者在後續對話中追問”為什麼”,模型可以參考之前的推理過程給出更深入的解釋
  • 修正之前的錯誤:當使用者指出回答中的問題時,模型可以在已有推理基礎上進行修正,而非從頭開始
  • 保持上下文一致性:跨輪次的推理文字幫助模型維持對話的邏輯連貫性

原生相容 OpenAI/Anthropic API

Qwen3.7-Max 的 API 介面原生相容 OpenAI API 和 Anthropic API 規範,這意味著:

  • 無需修改程式碼即可切換模型:如果你現有的應用使用 OpenAI 或 Anthropic SDK,只需更改 base_urlapi_key 即可使用 Qwen3.7-Max
  • 支援主流開發框架:LangChain、LlamaIndex、AutoGen 等框架可以直接接入
  • 降低遷移成本:對於已經使用其他模型 API 的團隊,遷移到 Qwen3.7-Max 的工作量最小化
# OpenAI SDK 相容呼叫範例
from openai import OpenAI

client = OpenAI(
    base_url="https://dashscope.aliyuncs.com/compatible-mode/v1",
    api_key="你的阿里雲API Key",
)

response = client.chat.completions.create(
    model="qwen3.7-max",
    messages=[
        {"role": "system", "content": "你是一個專業的AI助手。"},
        {"role": "user", "content": "請解釋量子計算的基本原理。"},
    ],
    max_tokens=4096,
)

print(response.choices[0].message.content)

使用方式

方式一:Qwen Chat 免費使用(推薦新手)

對於想要體驗 Qwen3.7-Max 但不想編寫程式碼的使用者,最直接的方式是透過 Qwen Chat 線上使用。

使用步驟:

  1. 存取 qwen.ai
  2. 使用手機號或郵箱註冊帳號
  3. 登入後即可在聊天介面中選擇 Qwen3.7-Max 模型
  4. 直接在對話框中輸入問題或上傳檔案

免費使用限制:

  • 每日有一定的免費額度(具體額度可能根據帳號等級調整)
  • 不支援自訂系統提示詞的高階設定
  • 不適合需要大量 API 呼叫的自動化場景

對於個人使用者偶爾查詢資訊、翻譯文件、生成創意內容等場景,Qwen Chat 的免費額度通常足夠使用。

方式二:阿里雲百煉 API 呼叫

對於開發者和企業使用者,透過阿里雲百煉平臺呼叫 API 是更靈活和強大的選擇。

開通步驟:

  1. 註冊阿里雲帳號(阿里雲官網
  2. 存取百煉平臺控制檯
  3. 開通「通義千問」服務並完成實名認證
  4. 建立 API Key
  5. 透過 SDK 或 REST API 呼叫

Python SDK 呼叫範例:

# 安裝 SDK
# pip install dashscope

import dashscope
from dashscope import Generation

dashscope.api_key = "你的API Key"

response = Generation.call(
    model="qwen3.7-max",
    prompt="請幫我寫一段關於人工智慧未來發展的簡短文章,約200字。",
    max_tokens=2048,
)

if response.status_code == 200:
    print(response.output.text)
else:
    print(f"錯誤: {response.code} - {response.message}")

方式三:相容 OpenAI API 的第三方工具接入

如果你使用 LangChain、LlamaIndex、AutoGen 等開發框架,可以直接使用 OpenAI 相容模式接入 Qwen3.7-Max:

# LangChain 整合範例
from langchain_openai import ChatOpenAI

llm = ChatOpenAI(
    model="qwen3.7-max",
    openai_api_key="你的API Key",
    openai_api_base="https://dashscope.aliyuncs.com/compatible-mode/v1",
    temperature=0.7,
)

response = llm.invoke("請列出 2026 年最值得關注的 5 個 AI 趨勢。")
print(response.content)

這種方式特別適合已有 OpenAI 生態經驗、希望快速接入新模型的開發者。

定價詳解

API 價格對比

Qwen3.7-Max 在阿里雲百煉平臺的定價如下:

專案價格($ / 百萬 tokens)
輸入$2.50
快取命中輸入$0.25
輸出$7.50
混合成本(7:2:1 比例)~$2.125

與其他主流模型的對比:

模型輸入價格輸出價格混合成本(約)
Qwen3.7-Max$2.50$7.50~$2.125
GPT-4o$2.50-5.00$10.00-15.00~$4.50
Claude Sonnet 4.6$3.00$15.00~$4.80
Gemini 3.5 Flash$1.25$5.00~$1.75

從定價來看,Qwen3.7-Max 的輸入價格與 GPT-4o 持平,但輸出價格僅為 GPT-4o 的一半。在綜合性價比方面,Qwen3.7-Max 明顯優於 GPT-4o 和 Claude Sonnet 4.6,但略高於 Gemini 3.5 Flash。

快取命中的成本優勢

Qwen3.7-Max 的快取命中輸入價格僅為 $0.25 / 百萬 tokens,是正常輸入價格的 1/10。如果你的應用場景涉及以下情況,善用快取可以大幅降低成本:

  • 固定系統提示詞:每次請求都攜帶相同的 system prompt,第一次正常計費,後續命中快取
  • 知識庫文件:將參考文件作為上下文輸入,重複使用時享受快取優惠
  • 批次資料處理:對大量相似資料使用相同處理模板,快取命中率會非常高

假設你的混合成本比例為 70% 輸入、20% 快取命中、10% 輸出:

實際成本 = 70% × $2.50 + 20% × $0.25 + 10% × $7.50
        = $1.75 + $0.05 + $0.75
        = $2.55 / 百萬 tokens

透過最佳化快取命中率,成本可以進一步降低。

免費使用限制

Qwen Chat 提供免費使用 Qwen3.7-Max 的機會,但有以下限制:

  • 每日免費額度:具體額度由阿里雲根據帳號型別動態調整,通常可滿足個人日常使用需求
  • 併發限制:免費使用者的併發請求數有限制,不適合高併發場景
  • 功能限制:部分高階功能(如自訂 system prompt、工具呼叫配置)僅在 API 中可用

對於需要穩定、大量呼叫的企業使用者,建議直接使用百煉平臺 API。

訓練方法揭秘

解耦式強化學習

Qwen3.7-Max 在訓練方法上的最大創新是採用了「解耦式強化學習」架構。傳統的強化學習方法通常將任務定義、工具呼叫框架和結果驗證器耦合在一起訓練,這導致模型容易學習到特定設定的「捷徑」,而在面對新場景時泛化能力不足。

阿里巴巴的解耦方法將三個核心元件分開訓練:

  1. 任務元件:定義模型需要完成的任務目標和約束條件
  2. 工具呼叫框架:定義模型可以使用的工具型別和呼叫方式
  3. 驗證器:評估模型輸出是否符合預期

透過在多種任務、框架、驗證器的組合上進行訓練,模型學會了更通用的推理能力,而非對特定訓練環境的記憶。這種方法顯著提升了模型在未知場景中的表現。

內部 Agent 測試:自主最佳化 attention kernel

在內部測試中,Qwen3.7-Max 展現了令人印象深刻的自主 Agent 能力。在一個 attention kernel(注意力核心)最佳化任務中,模型:

  • 在 35 小時內自主完成了 1158 次工具呼叫
  • 進行了 432 次程式碼評估和迭代
  • 最終將程式碼執行速度提升了 10 倍

整個過程中,模型自主規劃了「分析現有程式碼 → 提出最佳化方案 → 編寫新程式碼 → 測試驗證 → 迭代最佳化」的完整流程,幾乎不需要人工干預。這充分展示了 Qwen3.7-Max 在複雜工程任務中的自主決策和執行能力。

與 FreeAITool 其他 Qwen 文章對比

vs #035 Qwen3 Coder(開源 vs 閉源)

FreeAITool 此前詳細介紹過 Qwen3 Coder(#035),那是一款面向程式碼生成的開源模型。以下是兩者的關鍵區別:

維度Qwen3 Coder (#035)Qwen3.7-Max (#102)
模型型別開源閉源
主要定位程式碼生成和補全通用旗艦模型
參數公開部分公開未公開
使用方式可本地部署僅可透過 API/Qwen Chat 使用
最佳場景IDE 程式碼補全、程式碼生成對話、分析、多模態任務
成本免費(自部署算力成本)API 計費 / Qwen Chat 免費額度

簡單來說,Qwen3 Coder 適合需要在本地部署、對程式碼場景有專精需求的開發者;而 Qwen3.7-Max 適合需要強大通用能力、不想管理基礎設施的使用者。

vs #033 AI Leaderboard 排名更新

我們此前的 AI Leaderboard 文章(#033) 建立了大語言模型的綜合排名體系。Qwen3.7-Max 的加入將重新整理該排名的中文模型最高分,建議讀者將本文與此前的 Leaderboard 文章對照閱讀,瞭解當前 AI 模型的競爭格局。

常見問題 FAQ

Q: Qwen3.7-Max 免費嗎?

A: Qwen3.7-Max 透過阿里雲百煉平臺提供,新使用者有免費額度。之後按 token 計費,輸入約 ¥0.004/千 token,輸出約 ¥0.012/千 token。相比 GPT-5,價格約為其 1/3。

Q: Qwen3.7-Max 和 GPT-5 哪個更好?

A: 兩者各有優勢。Qwen3.7-Max 在中文任務上表現更好,價格更低;GPT-5 在多語言、程式碼生成和推理任務上更強。如果你的應用主要面向中文使用者,Qwen3.7-Max 性價比更高。

Q: Qwen3.7-Max 支援多長上下文?

A: Qwen3.7-Max 支援 128K token 上下文視窗,可以處理約 10 萬中文字元。適合長文件分析、程式碼庫理解和多輪對話。

Q: 如何使用 Qwen3.7-Max API?

A: 透過阿里雲百煉平臺獲取 API Key,然後使用 OpenAI 相容的 API 格式呼叫。支援 Python、JavaScript、Java 等主流 SDK。詳細教學見本文’使用方式’章節。

總結與建議

Qwen3.7-Max 是阿里巴巴在 2026 年的重要作品,它不僅代表了中文大語言模型的最高水平,也在全球 AI 競賽中佔據了前列位置。

我們推薦以下使用者群體使用 Qwen3.7-Max:

  • 🟢 中文內容創作者:在中文理解和生成方面,Qwen3.7-Max 具有天然的語言優勢,幻覺率低,內容質量高
  • 🟢 API 成本敏感型開發者:相比 GPT-4o 和 Claude Sonnet,Qwen3.7-Max 的性價比突出,且 API 完全相容
  • 🟢 需要長上下文分析的研究者:100 萬 tokens 的上下文視窗是大多數模型的 2-5 倍
  • 🟢 企業級應用:低幻覺率和工具呼叫能力使其適合構建可靠的商業應用

以下情況可以考慮其他方案:

  • 🔴 需要完全本地部署、資料不出網的場景:考慮開源模型如 Qwen3 Coder 或透過 Ollama 部署的開源模型
  • 🔴 預算極其有限的個人專案:Gemini 3.5 Flash 的 API 價格更低,且有更慷慨的免費額度
  • 🔴 追求極致推理能力:Claude Sonnet 4.6 在綜合智力排名上仍然領先

快速開始連結: