绯色av一区二区三区在线高清 ,欧美一,亚洲精品久久久久久国产精华液

首頁 > AI資訊 > 行業動態 > 推理水平對標OpenAIo1！阿里云開源首個AI推理模型QwQ：數學、編程尤為出色

推理水平對標OpenAIo1！阿里云開源首個AI推理模型QwQ：數學、編程尤為出色

新火種 2024-11-28

11月28日消息，今天，阿里云通義團隊宣布推出并同步開源了全新的AI推理模型——QwQ-32B-Preview。

評測顯示，預覽版本的QwQ（Qwen with Questions）在科學推理能力上展現出研究生水平，尤其在數學和編程領域表現卓越，其整體推理能力可與OpenAI的o1相媲美。

據介紹，QwQ是通義千問Qwen大模型最新推出的實驗性研究模型，也是阿里云首個開源的AI推理模型。

阿里云通義千問團隊研究發現，當模型有足夠的時間思考、質疑和反思時，其對數學和編程的理解就會深化，基于此QwQ取得了解決復雜問題的突破性進展。

推理水平對標OpenAI o1！阿里云開源首個AI推理模型QwQ：數學、編程尤為出色

在衡量科學問題解決能力的GPQA評測集中，QwQ達到了65.2%的準確率，顯示出其研究生水平的科學推理能力；在AIME評測中，QwQ以50%的勝率證明了其解決數學問題的能力。

在MATH-500評測中，QwQ以90.6%的高分超越了o1-preview和o1-mini。在評估高難度代碼生成的LiveCodeBench評測中，QwQ答對了一半的題目，在編程競賽題場景中也有出色表現。

不僅如此，QwQ在面對復雜問題時，能夠進行深度自省，質疑自身假設，并通過深思熟慮的自我對話，仔細審視其推理過程的每一步。

例如，在解決經典智力題“猜牌問題”時，QwQ通過梳理對話和推演，像個擅長思考的人一樣，并最終得出正確答案。

目前，QwQ-32B-Preview已在魔搭社區和HuggingFace等平臺上開源，發布短短幾小時，引起全球開發者熱情體驗。

有開發者認為該模型“是完全沒有預料到的瘋狂的躍進”、“今年開源領域最重大的突破”、“讓中國在開源大模型和AI推理上占據先機”。

不過通義團隊也表示，雖然QwQ展現了強大的分析能力，但其仍是個供研究的實驗型模型，存在不同語言的混合使用、偶有不恰當偏見、對專業領域問題不了解等局限，未來隨著研究深入模型迭代，這些問題將逐步得到解決。

推理水平對標OpenAI o1！阿里云開源首個AI推理模型QwQ：數學、編程尤為出色

Tags:

阿里模型

免責聲明: 本文所包含的觀點僅代表作者個人看法，不代表新火種的觀點。在新火種上獲取的所有信息均不應被視為投資建議。新火種對本文可能提及或鏈接的任何項目不表示認可。交易和投資涉及高風險，讀者在采取與本文內容相關的任何行動之前，請務必進行充分的盡職調查。最終的決策應該基于您自己的獨立判斷。新火種不對因依賴本文觀點而產生的任何金錢損失負任何責任。