Qwen3.7-Max 架構解析:100 萬 Token 上下文與 Kimi K3 比較

Qwen3.7-Max 架構解析,涵蓋 100 萬 Token 上下文視窗、AI Agent 能力、思考模式,以及程式開發與工具最佳化。

阿里雲將這款模型定位為長時間執行 AI Agent 工作流程的基礎模型,而不是一般的文字對話助手。它的核心方向包括程式開發、工具使用、流程自動化、複雜推論,以及在長時間任務中維持執行的一致性。

在實際應用中,許多 AI 任務並不是在第一步就失敗。更常見的情況是,模型執行到一半時忘記先前要求、重複已經失敗的操作、錯誤呼叫工具,或是在完成交付內容之前提前停止。

Qwen3.7-Max 的設計重點,正是處理這類問題。

什麼是 Qwen3.7-Max?

Qwen3.7-Max 是阿里雲針對 AI Agent 應用推出的旗艦模型,主要用於軟體工程、辦公自動化、多代理協作,以及需要長時間連續執行的複雜任務。

模型同時支援思考模式與非思考模式。面對分類、資訊擷取、內容改寫等較單純的請求時,可以使用速度較快的非思考模式;遇到規劃、除錯、驗證或多步驟任務時,則可以啟用較深入的推論能力。

Qwen3.7-Max 也能接入不同的 API 協定與 AI Agent 框架。開發團隊可以將它整合至程式開發工具、MCP 工具、企業內部系統與自動化流程,不必為了單一模型供應商重新建置整套應用架構。

「Qwen3.7-Max 架構」實際代表什麼?

目前阿里雲尚未完整公開 Qwen3.7-Max 的技術規格。模型總參數量、層數、啟用參數量與專家路由方式等資訊,都還沒有正式披露。

因此,在官方技術報告發布之前,不宜將未經證實的兆級參數量或特定 MoE 配置,當成已確認的模型規格。

現階段更值得關注的,是 Qwen3.7-Max 的實際運作方式:它如何處理長時間任務、如何操作外部工具,以及如何在連續執行過程中保留前面的判斷與任務狀態。

這套設計可以歸納為四個核心部分。

Qwen3.7-Max 四大設計核心,包括長時間 AI Agent 執行、跨框架泛化、思考狀態保留與 100 萬 Token 上下文視窗。

1. 長時間 AI Agent 執行能力

Qwen3.7-Max 的目標不是只完成幾輪簡單對話,而是在數百甚至數千個步驟中持續推進任務。

長上下文視窗只能讓模型接收更多內容,但不代表模型一定能在漫長流程中穩定運用這些資訊。

一個可靠的長時間 AI Agent,必須持續執行以下循環:

  • 檢查目前的工作環境;
  • 判斷下一步應該執行的動作;
  • 選擇並呼叫適合的工具;
  • 檢查工具回傳結果;
  • 修正失敗或不完整的操作;
  • 保留先前的重要判斷;
  • 持續執行,直到任務真正完成。

阿里雲曾展示一項持續約 35 小時的自動化核心效能最佳化任務。在這項測試中,Qwen3.7-Max 完成了 1,158 次工具呼叫與 432 次核心評估,並持續執行程式撰寫、編譯、效能分析與修改。

最終實作相較於參考版本,取得約 10 倍的幾何平均效能提升。

比最終數字更重要的是整個執行過程。即使任務已經運作超過 30 小時,模型仍能持續找到有效的最佳化方向,而不是陷入重複循環或提前放棄。

2. 跨框架泛化能力

部分 AI Agent 模型只在特定工具環境中表現良好。一旦切換到其他程式助理、瀏覽器自動化工具或工作流程框架,表現可能明顯下降。

Qwen3.7-Max 的設計目標之一,是適應不同的 AI Agent 執行環境,而不是綁定單一介面或平台。

阿里雲曾在 Qwen Code、OpenClaw、程式開發代理與自訂工具系統中測試這款模型。

這種跨框架能力對企業應用相當重要。企業可能使用一套工具處理程式開發,另一套工具執行瀏覽器自動化,再透過第三套工具處理內部文件。

底層模型需要理解不同的工具描述、參數格式與回傳內容,而不是每更換一套環境,就重新訓練模型或大幅調整提示詞。

這可以降低模型導入後的整合成本,也能減少模型只能在官方示範環境中正常運作的風險。

3. 思考狀態保留

Qwen3.7-Max 支援一項名為 preserve_thinking 的功能。

啟用後,先前回合中的部分推論資訊可以保留在對話紀錄內。對長時間 AI Agent 而言,這有助於模型記住先前為何選擇某個方案、哪些假設已經排除,以及目前還有哪些問題尚未解決。

例如,一個程式開發代理已經完成以下工作:

  1. 檢查專案程式碼;
  2. 找出三個可能的錯誤原因;
  3. 驗證其中兩個原因;
  4. 修改多個檔案;
  5. 發現原本的假設不成立。

若下一個回合只提供最新的工具回傳結果,模型可能重複前面已經完成的檢查,或做出與先前修改互相衝突的決定。

保留必要的思考狀態,可以幫助模型在長流程中維持較好的執行連續性。

不過,這項功能也不適合無限制使用。保留過多中間內容會增加上下文使用量,也可能讓已經失效的判斷持續影響後續任務。

在正式環境中,更合理的方式是將思考狀態保留與以下機制搭配使用:

  • 上下文摘要;
  • 結構化任務狀態;
  • 外部記憶儲存;
  • 階段性檢查點;
  • 過期資訊清理。

4. 100 萬 Token 上下文視窗

目前阿里雲公開資料顯示,Qwen3.7-Max 最高可支援約 100 萬個輸入 Token。

這樣的上下文容量,可以用來處理大型程式碼儲存庫、長篇文件、多輪對話紀錄,以及複雜的工具呼叫紀錄。

常見應用情境包括:

  • 完整程式碼儲存庫分析;
  • 合約與政策文件審閱;
  • 財務資料處理;
  • 長時間研究工作;
  • 多文件資訊檢索;
  • 持續運作的 AI Agent 對話;
  • 大量工具執行結果分析。

不過,100 萬 Token 並不代表每次請求都應該把所有資料一次送給模型。

輸入內容越長,處理成本通常越高,模型也可能更難找出真正重要的資訊。

較可靠的正式環境通常會同時使用:

  • 檢索增強生成;
  • 結構化記憶;
  • 上下文快取;
  • 定期內容壓縮;
  • 分階段任務處理。

大型上下文視窗更適合作為額外容量,而不是完全取代上下文管理。

思考模式與非思考模式

Qwen3.7-Max 同時支援思考模式與非思考模式。

非思考模式較適合以下任務:

  • 文字分類;
  • 資訊擷取;
  • 內容改寫;
  • 簡短摘要;
  • 一般客服回覆;
  • 結構化資料產生。

思考模式則較適合:

  • 多步驟規劃;
  • 複雜程式問題;
  • 數學推論;
  • 工具選擇;
  • 錯誤排查;
  • 多項限制條件處理;
  • 中間結果驗證。

並不是每個請求都需要使用最深入的推論模式。

對簡單任務啟用複雜推論,可能只會增加延遲與輸出 Token 用量,而不會明顯改善結果。較實用的方式,是依照任務複雜度、回應時間要求與成本預算,動態選擇適合的模式。

Qwen3.7-Max 適合哪些應用情境?

程式開發代理

Qwen3.7-Max 的重點不只是產生單一程式片段,而是處理更完整的軟體開發流程。

它可以檢查既有專案、修改多個檔案、執行指令、分析錯誤,並根據測試或編譯結果繼續調整方案。

適用情境包括:

  • 專案級程式碼重構;
  • 前端開發;
  • 測試案例產生;
  • 相依套件版本遷移;
  • 錯誤排查;
  • 效能最佳化;
  • 企業內部開發助理。

當模型可以存取受控的執行環境,並從測試、編譯器或評估程式取得明確回饋時,實際價值會更加明顯。

辦公與文件自動化

Qwen3.7-Max 也可以作為能操作工具的辦公助理,用來處理試算表、文件、格式要求與多步驟辦公流程。

可能的用途包括:

  • 製作結構化報告;
  • 審閱大量文件;
  • 整理與格式化長篇文件;
  • 建立試算表模型;
  • 從商業文件中擷取資訊;
  • 製作簡報初稿;
  • 協調多個生產力工具。

這些流程仍然需要驗證。

模型可能產生外觀看似完整的文件,但內容中仍可能存在計算、格式或事實錯誤。涉及財務、法律與營運資料時,仍應保留自動檢查與人工審核。

企業 AI Agent

Qwen3.7-Max 可以作為企業 AI Agent 的推論層,並與內部知識庫或商業系統整合。

例如,一個企業 AI Agent 可以:

  1. 從知識庫查詢資料;
  2. 呼叫內部系統取得紀錄;
  3. 更新公司文件;
  4. 產生處理摘要;
  5. 在執行敏感操作前要求審核。

需要注意的是,模型本身並不等於完整的企業安全系統。

權限控管、稽核紀錄、資料隔離與法規遵循,仍需要由周邊系統負責。評估模型能力時,也應將系統安全與模型表現分開檢視。

Qwen3.7-Max 與 Kimi K3 比較

Qwen3.7-Max 與 Kimi K3 都針對程式開發、複雜推論與 AI Agent 工作流程設計,但兩者公開的技術資訊有明顯差異。

比較項目 Qwen3.7-Max Kimi K3
供應商 阿里雲 Moonshot AI
發布形式 專有 API 模型 開放模型與 API
公開參數規模 尚未公開 2.8 兆
上下文視窗 最高支援 100 萬 Token 最高支援 100 萬 Token
輸入能力 以文字輸入為主 原生支援文字與視覺輸入
推論模式 思考與非思考模式 可調整推論強度
架構公開程度 公開資訊有限 已公開 KDA、注意力殘差與稀疏 MoE
主要定位 長時間 AI Agent 與跨框架工具呼叫 程式開發、知識工作、推論與視覺任務
專家啟用 尚未公開 每次啟用 896 個專家中的 16 個

 

Moonshot AI 對 Kimi K3 的架構提供了較完整的公開資訊。

目前資料顯示,Kimi K3 擁有 2.8 兆參數,並結合 Kimi Delta Attention、注意力殘差機制與稀疏混合專家架構。每次推論會啟用 896 個專家中的 16 個。

Kimi K3 也提供原生視覺能力與 100 萬 Token 上下文,因此較適合需要同時處理程式碼、畫面截圖、文件與視覺資訊的工作流程。

Qwen3.7-Max 的公開定位則有所不同。

阿里雲更強調模型在實際任務中的執行能力,包括長時間 AI Agent 運作、工具呼叫、辦公自動化,以及在不同代理框架中的穩定性。

兩者應如何選擇,主要取決於實際應用需求。

較適合選擇 Qwen3.7-Max 的情況包括:

  • 需要長時間連續執行;
  • 需要部署於不同 AI Agent 框架;
  • 需要頻繁呼叫外部工具;
  • 主要處理程式開發與辦公自動化;
  • 需要控制思考與非思考模式;
  • 已使用阿里雲基礎設施。

較適合評估 Kimi K3 的情況包括:

  • 需要原生圖像理解;
  • 需要查看較完整的架構資訊;
  • 需要開放模型能力;
  • 需要處理大型程式碼上下文;
  • 涉及視覺知識工作;
  • 需要進行模型研究或架構客製化。

參數規模不應成為唯一判斷標準。

即使某個模型的參數量較大,如果它的工具呼叫、後訓練方式、上下文管理或推論配置不適合目前的工作流程,實際表現仍可能不如規模較小的模型。

Qwen3.8-Max-Preview 值得關注嗎?

Qwen3.8-Max-Preview 是阿里雲 Model Studio Token Plan 中提供的預覽模型。

目前公開說明將它定位為 Qwen 系列中能力更強的新版本,並強調全端開發、資料分析、辦公流程與視覺理解。

不過,現有公開資料尚未完整揭露以下資訊:

  • 模型總參數量;
  • 啟用參數量;
  • 專家數量;
  • 專家啟用方式;
  • 完整模型架構。

因此,在沒有正式技術報告支持的情況下,不宜將「2.4 兆參數」或特定 MoE 配置,當成已經確認的模型規格。

預覽版本本身也具有一定的不確定性。

模型能力、名稱與可用時間可能在測試期間調整,後續也可能被正式版本取代。正式環境不應過度依賴預覽模型目前的行為或識別名稱。

如何評估 Qwen3.7-Max 是否適合正式環境?

公開基準測試可以作為初步篩選依據,但無法完整反映企業內部的工具設定、資料結構、提示詞與回應時間要求。

更可靠的方式,是使用真實業務任務進行測試。

建立具代表性的測試集

測試內容應涵蓋:

  • 簡單與困難的請求;
  • 短上下文與長上下文;
  • 成功與失敗的工具呼叫;
  • 描述不完整的指令;
  • 多語言輸入;
  • 大型程式碼儲存庫任務;
  • 多輪修改與驗證。

不要只評估回答品質

建議同時記錄:

  • 任務完成率;
  • 工具呼叫正確率;
  • 總完成時間;
  • 輸入與輸出 Token;
  • 重試次數;
  • 上下文成長速度;
  • 缺乏依據的結論;
  • 人工修正時間;
  • 每個成功任務的實際成本。

對 AI Agent 應用而言,單次請求價格並不是最重要的指標。

如果價格較低的模型需要多次重試,或最終仍無法完成任務,其實際成本可能反而更高。更有參考價值的指標是:完成一個合格任務需要多少成本。

測試長時間工作階段

既然 Qwen3.7-Max 主要面向長時間 AI Agent,就應該在長工作階段中驗證。

測試時可特別觀察模型是否會:

  • 重複已完成的操作;
  • 忘記先前限制條件;
  • 沒有理由地改變執行方向;
  • 提前停止;
  • 累積大量無關上下文;
  • 在工具呼叫失敗後恢復;
  • 驗證最終產出結果。

保留備援模型

沒有任何單一模型能在所有任務中持續維持最佳表現。

正式系統可以根據任務類型,將程式開發、視覺分析、簡單資訊擷取與複雜推論分配給不同模型。

備援模型也能降低以下風險:

  • 服務供應商異常;
  • API 請求限制;
  • 模型版本調整;
  • 單一模型輸出異常。

透過統一 API 接入 Qwen 模型

 

ApiSmart 透過統一 API 串接 Qwen、Kimi、Claude、Gemini 與 DeepSeek,提供單一端點、統一計費、備援路由及即時模型目錄。

分別整合不同模型供應商,會持續增加開發與維護工作。

團隊需要分別管理:

  • 不同的 API 憑證;
  • 不同的請求格式;
  • 不同的計費系統;
  • 不同的錯誤回應;
  • 不同的模型名稱;
  • 不同的技術文件。

ApiSmart 為目前支援的 AI 模型提供統一 API 層,讓開發人員可以透過一套整合方式管理多個模型。

透過統一介面,團隊可以更方便地:

  • 測試不同模型;
  • 比較輸出品質;
  • 統一查看使用情況;
  • 集中管理費用;
  • 設定備援路由;
  • 在不同模型之間切換;
  • 減少重複開發工作。

在選擇正式使用的模型之前,建議先查看 ApiSmart 的即時模型目錄,確認目前可用的模型、支援功能與最新價格。

總結

Qwen3.7-Max 的重點,並不在於一個尚未公開的參數數字,而在於它如何完成實際任務。

長時間推論、持續工具呼叫、跨框架部署與複雜任務執行,是這款模型最值得關注的能力。

Kimi K3 提供較透明的架構資訊、原生視覺輸入,以及已公開的 2.8 兆參數設計。Qwen3.8-Max-Preview 則代表更新的多模態發展方向,但其完整架構仍未正式揭露。

對開發人員與企業而言,最後的選擇不應只依賴模型發布時的宣傳數據。

更重要的是測試每個模型能否穩定完成整體任務、需要多少人工介入,以及每次成功交付的實際成本。

最適合正式環境的模型,未必是參數量最大的模型,而是能夠穩定把工作完成的模型。