0
| 本文作者: 徐咪 | 2026-08-03 10:49 |
8月3日,阿里巴巴正式發布新一代基座大模型Qwen3.8,總參數量2.4萬億,在編程(Coding)和專業辦公(Cowork)方面能力大幅提升。今日放榜的權威三方榜單Arena中,阿里Qwen模型僅次于Anthropic的Claude系列,整體性能處于全球大模型第一梯隊。目前,Qwen3.8的API已上線千問AI平臺,并接入阿里今日同步推出的Agent產品“千問辦公”。Qwen3.8-Max預計下周開源,同時還將開源 Qwen3.8-27B。
今日起,全球開發者都可通過千問AI平臺獲得Qwen3.8的API服務,國內每百萬Tokens輸入12元、輸出36元,隱式緩存命中僅1.5元,而輸入與輸出的國際價格僅為Opus5的40%與24%,實現相近智能更高性價比。
圖說:權威三方榜單Arena全球排行榜更新
此次發布的是千問大模型系列中尺寸最大、性能最強的旗艦模型Qwen3.8-Max,它支持視覺理解,上下文長度達1M Tokens。在模型架構上,Qwen3.8通過稀疏MoE架構與混合注意力機制的聯合優化,首次將千問大模型的總參數量拓展至2.4T,激活95B,獲得了更高的推理效率、更快的推理速度,整體性能也迎來新突破:在科研復現評測PaperBench等編程智能體評測中,Qwen3.8-Max較上代模型大幅提升28.2分,以93.0分錄得評測新高;在WideSearch、Agent's Last Exam等通用智能體評測中,新模型分別取得81.9分和52.4分,位居前沿。同時,Qwen3.8在指令遵循IF Bench評測中斬獲82.8分,科學推理GPQA Diamond取得92.6分,系列通用能力均位居前列;在視覺推理BabyVision評測中,Qwen3.8-Max在無工具條件下取得82.0分,超出部分主流模型近兩倍,在評估智能體電腦操作能力的OSWorld-Verified評測中,Qwen3.8-Max以86.1分位居主流模型首位。
編程能力(Coding)是前沿大模型的核心能力之一,Qwen3.8實現了自主編程的新突破。在權威CodeArena榜中,Qwen3.8位居全球第四。2年前的前沿模型能寫好函數、補全代碼,成為程序員的有力幫手,而如今,Qwen3.8可以從一個空文件夾出發,自主完成一個十數天的真實項目交付,全程無需人干預。只需一句“創建一個自進化的智能體Harness”,Qwen3.8就像個資深的工程師,從零開始,自主搭建循環工程(Loop Engineering)框架,編排智能體自動領取和執行任務,人類工程師還可通過釘釘給Qwen3.8提出新要求。Qwen3.8獨立編程運行約 16 天后,做出了一個Hermes Agent級別的、真實可用的自進化智能體框架“oh-my-cli”,目前該項目現已完全開源,完整過程公開保存在 GitHub 倉庫里,可供所有人查看。
Qwen3.8可勝任廣泛的、真實的專業工作任務(Cowork)。面對完全不同的專業任務、評判標準和計算需求,Qwen3.8通過真實環境和算力的聯合強化學習(RL)擴展,實現了數百種高價值、高頻專業任務的真實表現提升,在主流的智能體框架中均可穩定可靠地交付生產級成果:一支法務助理團隊在數百份法律文檔中標注千余個相關條款,需要一周時間,Qwen3.8一小時內就能做完;一個籃球數據分析團隊逐幀標注160個小時以上的比賽錄像,Qwen3.8數十分鐘就可精準拆解這8400多個攻防回合,并一次性輸出球員戰術畫像和教練報告;一個金融研究團隊基于數年的專業知識積累,搜集資本市場全面、實時的變動,才能依次完成的量化策略研究,Qwen3.8自主調動并行的智能體,連續工作數小時后交付完整的 ETF 輪動策略,并持續分析回測、動態修正、最后實現規模化盈利。
在長周期任務中,Qwen3.8涌現出系統級自主規劃與全棧閉環自適應學習能力。無論是在高精密、強物理約束的數字芯片設計,還是在高度動態、博弈激烈的商業模擬運營中,Qwen3.8均能通過“執行-反饋-迭代”的自適應閉環,在數千輪的超長程交互中實現算法與策略的深度重構。
Qwen3.8除了擁有強大的文本和推理能力,還提高了AI視覺理解能力的極限。在權威Vision Arena榜單中,Qwen3.8-Max排名全球第二。Qwen3.8不僅能讀懂200頁的財報PDF、看懂超100小時的長視頻,還能將這些“看到”的知識和信息反饋到工作全流程去,幫助模型思考得更周全。在千問團隊構建的“應用復刻”基準RecreationBench長程任務中,模型沒有源代碼,也無法聯網,只通過交互與反饋去理解這個應用,卻能從零復刻出整個應用。這表明,Qwen3.8已經展現出前沿水準的混合多模態智能體能力,通過“迭代編程—交互反饋”的反復循環,將視覺編程(Visual Coding)推向新的高度。
據了解,阿里真武M890超節點也已成功適配Qwen3.8,通過芯片、云平臺與千問大模型的全鏈路優化,顯著提升推理效率、降低推理成本,在Agentic推理場景中最多可實現1.5倍性能提升。