Qwen3.7-Max 架構解析:100 萬 Token 上下文與 Kimi K3 比較

阿里雲將這款模型定位為長時間執行 AI Agent 工作流程的基礎模型,而不是一般的文字對話助手。它的核心方向包括程式開發、工具使用、流程自動化、複雜推論,以及在長時間任務中維持執行的一致性。
在實際應用中,許多 AI 任務並不是在第一步就失敗。更常見的情況是,模型執行到一半時忘記先前要求、重複已經失敗的操作、錯誤呼叫工具,或是在完成交付內容之前提前停止。
Qwen3.7-Max 的設計重點,正是處理這類問題。
什麼是 Qwen3.7-Max?
Qwen3.7-Max 是阿里雲針對 AI Agent 應用推出的旗艦模型,主要用於軟體工程、辦公自動化、多代理協作,以及需要長時間連續執行的複雜任務。
模型同時支援思考模式與非思考模式。面對分類、資訊擷取、內容改寫等較單純的請求時,可以使用速度較快的非思考模式;遇到規劃、除錯、驗證或多步驟任務時,則可以啟用較深入的推論能力。
Qwen3.7-Max 也能接入不同的 API 協定與 AI Agent 框架。開發團隊可以將它整合至程式開發工具、MCP 工具、企業內部系統與自動化流程,不必為了單一模型供應商重新建置整套應用架構。
「Qwen3.7-Max 架構」實際代表什麼?
目前阿里雲尚未完整公開 Qwen3.7-Max 的技術規格。模型總參數量、層數、啟用參數量與專家路由方式等資訊,都還沒有正式披露。
因此,在官方技術報告發布之前,不宜將未經證實的兆級參數量或特定 MoE 配置,當成已確認的模型規格。
現階段更值得關注的,是 Qwen3.7-Max 的實際運作方式:它如何處理長時間任務、如何操作外部工具,以及如何在連續執行過程中保留前面的判斷與任務狀態。
這套設計可以歸納為四個核心部分。

1. 長時間 AI Agent 執行能力
Qwen3.7-Max 的目標不是只完成幾輪簡單對話,而是在數百甚至數千個步驟中持續推進任務。
長上下文視窗只能讓模型接收更多內容,但不代表模型一定能在漫長流程中穩定運用這些資訊。
一個可靠的長時間 AI Agent,必須持續執行以下循環:
- 檢查目前的工作環境;
- 判斷下一步應該執行的動作;
- 選擇並呼叫適合的工具;
- 檢查工具回傳結果;
- 修正失敗或不完整的操作;
- 保留先前的重要判斷;
- 持續執行,直到任務真正完成。
阿里雲曾展示一項持續約 35 小時的自動化核心效能最佳化任務。在這項測試中,Qwen3.7-Max 完成了 1,158 次工具呼叫與 432 次核心評估,並持續執行程式撰寫、編譯、效能分析與修改。
最終實作相較於參考版本,取得約 10 倍的幾何平均效能提升。
比最終數字更重要的是整個執行過程。即使任務已經運作超過 30 小時,模型仍能持續找到有效的最佳化方向,而不是陷入重複循環或提前放棄。
2. 跨框架泛化能力
部分 AI Agent 模型只在特定工具環境中表現良好。一旦切換到其他程式助理、瀏覽器自動化工具或工作流程框架,表現可能明顯下降。
Qwen3.7-Max 的設計目標之一,是適應不同的 AI Agent 執行環境,而不是綁定單一介面或平台。
阿里雲曾在 Qwen Code、OpenClaw、程式開發代理與自訂工具系統中測試這款模型。
這種跨框架能力對企業應用相當重要。企業可能使用一套工具處理程式開發,另一套工具執行瀏覽器自動化,再透過第三套工具處理內部文件。
底層模型需要理解不同的工具描述、參數格式與回傳內容,而不是每更換一套環境,就重新訓練模型或大幅調整提示詞。
這可以降低模型導入後的整合成本,也能減少模型只能在官方示範環境中正常運作的風險。
3. 思考狀態保留
Qwen3.7-Max 支援一項名為 preserve_thinking 的功能。
啟用後,先前回合中的部分推論資訊可以保留在對話紀錄內。對長時間 AI Agent 而言,這有助於模型記住先前為何選擇某個方案、哪些假設已經排除,以及目前還有哪些問題尚未解決。
例如,一個程式開發代理已經完成以下工作:
- 檢查專案程式碼;
- 找出三個可能的錯誤原因;
- 驗證其中兩個原因;
- 修改多個檔案;
- 發現原本的假設不成立。
若下一個回合只提供最新的工具回傳結果,模型可能重複前面已經完成的檢查,或做出與先前修改互相衝突的決定。
保留必要的思考狀態,可以幫助模型在長流程中維持較好的執行連續性。
不過,這項功能也不適合無限制使用。保留過多中間內容會增加上下文使用量,也可能讓已經失效的判斷持續影響後續任務。
在正式環境中,更合理的方式是將思考狀態保留與以下機制搭配使用:
- 上下文摘要;
- 結構化任務狀態;
- 外部記憶儲存;
- 階段性檢查點;
- 過期資訊清理。
4. 100 萬 Token 上下文視窗
目前阿里雲公開資料顯示,Qwen3.7-Max 最高可支援約 100 萬個輸入 Token。
這樣的上下文容量,可以用來處理大型程式碼儲存庫、長篇文件、多輪對話紀錄,以及複雜的工具呼叫紀錄。
常見應用情境包括:
- 完整程式碼儲存庫分析;
- 合約與政策文件審閱;
- 財務資料處理;
- 長時間研究工作;
- 多文件資訊檢索;
- 持續運作的 AI Agent 對話;
- 大量工具執行結果分析。
不過,100 萬 Token 並不代表每次請求都應該把所有資料一次送給模型。
輸入內容越長,處理成本通常越高,模型也可能更難找出真正重要的資訊。
較可靠的正式環境通常會同時使用:
- 檢索增強生成;
- 結構化記憶;
- 上下文快取;
- 定期內容壓縮;
- 分階段任務處理。
大型上下文視窗更適合作為額外容量,而不是完全取代上下文管理。
思考模式與非思考模式
Qwen3.7-Max 同時支援思考模式與非思考模式。
非思考模式較適合以下任務:
- 文字分類;
- 資訊擷取;
- 內容改寫;
- 簡短摘要;
- 一般客服回覆;
- 結構化資料產生。
思考模式則較適合:
- 多步驟規劃;
- 複雜程式問題;
- 數學推論;
- 工具選擇;
- 錯誤排查;
- 多項限制條件處理;
- 中間結果驗證。
並不是每個請求都需要使用最深入的推論模式。
對簡單任務啟用複雜推論,可能只會增加延遲與輸出 Token 用量,而不會明顯改善結果。較實用的方式,是依照任務複雜度、回應時間要求與成本預算,動態選擇適合的模式。
Qwen3.7-Max 適合哪些應用情境?
程式開發代理
Qwen3.7-Max 的重點不只是產生單一程式片段,而是處理更完整的軟體開發流程。
它可以檢查既有專案、修改多個檔案、執行指令、分析錯誤,並根據測試或編譯結果繼續調整方案。
適用情境包括:
- 專案級程式碼重構;
- 前端開發;
- 測試案例產生;
- 相依套件版本遷移;
- 錯誤排查;
- 效能最佳化;
- 企業內部開發助理。
當模型可以存取受控的執行環境,並從測試、編譯器或評估程式取得明確回饋時,實際價值會更加明顯。
辦公與文件自動化
Qwen3.7-Max 也可以作為能操作工具的辦公助理,用來處理試算表、文件、格式要求與多步驟辦公流程。
可能的用途包括:
- 製作結構化報告;
- 審閱大量文件;
- 整理與格式化長篇文件;
- 建立試算表模型;
- 從商業文件中擷取資訊;
- 製作簡報初稿;
- 協調多個生產力工具。
這些流程仍然需要驗證。
模型可能產生外觀看似完整的文件,但內容中仍可能存在計算、格式或事實錯誤。涉及財務、法律與營運資料時,仍應保留自動檢查與人工審核。
企業 AI Agent
Qwen3.7-Max 可以作為企業 AI Agent 的推論層,並與內部知識庫或商業系統整合。
例如,一個企業 AI Agent 可以:
- 從知識庫查詢資料;
- 呼叫內部系統取得紀錄;
- 更新公司文件;
- 產生處理摘要;
- 在執行敏感操作前要求審核。
需要注意的是,模型本身並不等於完整的企業安全系統。
權限控管、稽核紀錄、資料隔離與法規遵循,仍需要由周邊系統負責。評估模型能力時,也應將系統安全與模型表現分開檢視。
Qwen3.7-Max 與 Kimi K3 比較
Qwen3.7-Max 與 Kimi K3 都針對程式開發、複雜推論與 AI Agent 工作流程設計,但兩者公開的技術資訊有明顯差異。
Moonshot AI 對 Kimi K3 的架構提供了較完整的公開資訊。
目前資料顯示,Kimi K3 擁有 2.8 兆參數,並結合 Kimi Delta Attention、注意力殘差機制與稀疏混合專家架構。每次推論會啟用 896 個專家中的 16 個。
Kimi K3 也提供原生視覺能力與 100 萬 Token 上下文,因此較適合需要同時處理程式碼、畫面截圖、文件與視覺資訊的工作流程。
Qwen3.7-Max 的公開定位則有所不同。
阿里雲更強調模型在實際任務中的執行能力,包括長時間 AI Agent 運作、工具呼叫、辦公自動化,以及在不同代理框架中的穩定性。
兩者應如何選擇,主要取決於實際應用需求。
較適合選擇 Qwen3.7-Max 的情況包括:
- 需要長時間連續執行;
- 需要部署於不同 AI Agent 框架;
- 需要頻繁呼叫外部工具;
- 主要處理程式開發與辦公自動化;
- 需要控制思考與非思考模式;
- 已使用阿里雲基礎設施。
較適合評估 Kimi K3 的情況包括:
- 需要原生圖像理解;
- 需要查看較完整的架構資訊;
- 需要開放模型能力;
- 需要處理大型程式碼上下文;
- 涉及視覺知識工作;
- 需要進行模型研究或架構客製化。
參數規模不應成為唯一判斷標準。
即使某個模型的參數量較大,如果它的工具呼叫、後訓練方式、上下文管理或推論配置不適合目前的工作流程,實際表現仍可能不如規模較小的模型。
Qwen3.8-Max-Preview 值得關注嗎?
Qwen3.8-Max-Preview 是阿里雲 Model Studio Token Plan 中提供的預覽模型。
目前公開說明將它定位為 Qwen 系列中能力更強的新版本,並強調全端開發、資料分析、辦公流程與視覺理解。
不過,現有公開資料尚未完整揭露以下資訊:
- 模型總參數量;
- 啟用參數量;
- 專家數量;
- 專家啟用方式;
- 完整模型架構。
因此,在沒有正式技術報告支持的情況下,不宜將「2.4 兆參數」或特定 MoE 配置,當成已經確認的模型規格。
預覽版本本身也具有一定的不確定性。
模型能力、名稱與可用時間可能在測試期間調整,後續也可能被正式版本取代。正式環境不應過度依賴預覽模型目前的行為或識別名稱。
如何評估 Qwen3.7-Max 是否適合正式環境?
公開基準測試可以作為初步篩選依據,但無法完整反映企業內部的工具設定、資料結構、提示詞與回應時間要求。
更可靠的方式,是使用真實業務任務進行測試。
建立具代表性的測試集
測試內容應涵蓋:
- 簡單與困難的請求;
- 短上下文與長上下文;
- 成功與失敗的工具呼叫;
- 描述不完整的指令;
- 多語言輸入;
- 大型程式碼儲存庫任務;
- 多輪修改與驗證。
不要只評估回答品質
建議同時記錄:
- 任務完成率;
- 工具呼叫正確率;
- 總完成時間;
- 輸入與輸出 Token;
- 重試次數;
- 上下文成長速度;
- 缺乏依據的結論;
- 人工修正時間;
- 每個成功任務的實際成本。
對 AI Agent 應用而言,單次請求價格並不是最重要的指標。
如果價格較低的模型需要多次重試,或最終仍無法完成任務,其實際成本可能反而更高。更有參考價值的指標是:完成一個合格任務需要多少成本。
測試長時間工作階段
既然 Qwen3.7-Max 主要面向長時間 AI Agent,就應該在長工作階段中驗證。
測試時可特別觀察模型是否會:
- 重複已完成的操作;
- 忘記先前限制條件;
- 沒有理由地改變執行方向;
- 提前停止;
- 累積大量無關上下文;
- 在工具呼叫失敗後恢復;
- 驗證最終產出結果。
保留備援模型
沒有任何單一模型能在所有任務中持續維持最佳表現。
正式系統可以根據任務類型,將程式開發、視覺分析、簡單資訊擷取與複雜推論分配給不同模型。
備援模型也能降低以下風險:
- 服務供應商異常;
- API 請求限制;
- 模型版本調整;
- 單一模型輸出異常。
透過統一 API 接入 Qwen 模型

分別整合不同模型供應商,會持續增加開發與維護工作。
團隊需要分別管理:
- 不同的 API 憑證;
- 不同的請求格式;
- 不同的計費系統;
- 不同的錯誤回應;
- 不同的模型名稱;
- 不同的技術文件。
ApiSmart 為目前支援的 AI 模型提供統一 API 層,讓開發人員可以透過一套整合方式管理多個模型。
透過統一介面,團隊可以更方便地:
- 測試不同模型;
- 比較輸出品質;
- 統一查看使用情況;
- 集中管理費用;
- 設定備援路由;
- 在不同模型之間切換;
- 減少重複開發工作。
在選擇正式使用的模型之前,建議先查看 ApiSmart 的即時模型目錄,確認目前可用的模型、支援功能與最新價格。
總結
Qwen3.7-Max 的重點,並不在於一個尚未公開的參數數字,而在於它如何完成實際任務。
長時間推論、持續工具呼叫、跨框架部署與複雜任務執行,是這款模型最值得關注的能力。
Kimi K3 提供較透明的架構資訊、原生視覺輸入,以及已公開的 2.8 兆參數設計。Qwen3.8-Max-Preview 則代表更新的多模態發展方向,但其完整架構仍未正式揭露。
對開發人員與企業而言,最後的選擇不應只依賴模型發布時的宣傳數據。
更重要的是測試每個模型能否穩定完成整體任務、需要多少人工介入,以及每次成功交付的實際成本。
最適合正式環境的模型,未必是參數量最大的模型,而是能夠穩定把工作完成的模型。

