国产精品一二级,免费美女毛片,午夜免费啪视频

首頁(yè) > AI資訊 > 行業(yè)動(dòng)態(tài) > 推理水平對(duì)標(biāo)OpenAIo1！阿里云通義開源最新推理模型QwQ

推理水平對(duì)標(biāo)OpenAIo1！阿里云通義開源最新推理模型QwQ

新火種 2024-11-29

11月28日，阿里云通義團(tuán)隊(duì)發(fā)布全新AI推理模型QwQ-32B-Preview，并同步開源。評(píng)測(cè)數(shù)據(jù)顯示，預(yù)覽版本的QwQ，已展現(xiàn)出研究生水平的科學(xué)推理能力，在數(shù)學(xué)和編程方面表現(xiàn)尤為出色，整體推理水平比肩OpenAI o1。

QwQ（Qwen with Questions）是通義千問Qwen大模型最新推出的實(shí)驗(yàn)性研究模型，也是阿里云首個(gè)開源的AI推理模型。阿里云通義千問團(tuán)隊(duì)研究發(fā)現(xiàn)，當(dāng)模型有足夠的時(shí)間思考、質(zhì)疑和反思時(shí)，其對(duì)數(shù)學(xué)和編程的理解就會(huì)深化。基于此，QwQ取得了解決復(fù)雜問題的突破性進(jìn)展。

在考察科學(xué)問題解決能力的GPQA評(píng)測(cè)集上，QwQ獲得65.2%的準(zhǔn)確率，具備研究生水平的科學(xué)推理能力；在涵蓋綜合數(shù)學(xué)主題的AIME評(píng)測(cè)中，QwQ以50%的勝率證明其擁有解決數(shù)學(xué)問題的豐富技能；在全面考察數(shù)學(xué)解題能力的MATH-500評(píng)測(cè)中，QwQ斬獲90.6%的高分，一舉超越o1-preview和o1-mini；在評(píng)估高難度代碼生成的LiveCodeBench評(píng)測(cè)中，QwQ答對(duì)一半的題，在編程競(jìng)賽題場(chǎng)景中也有出色表現(xiàn)。

面對(duì)復(fù)雜問題，QwQ展現(xiàn)了深度自省的能力，會(huì)質(zhì)疑自身假設(shè)，進(jìn)行深思熟慮的自我對(duì)話，并仔細(xì)審視其推理過程的每一步。比如，在經(jīng)典智力題“猜牌問題”中，QwQ通過梳理各方對(duì)話并推演現(xiàn)實(shí)情況，像個(gè)擅長(zhǎng)思考的人一樣，揣摩“這句話有點(diǎn)tricky”，反思“等一下，也許我需要更仔細(xì)地思考”，最終分析得出正確答案，讓人驚艷。

目前，QwQ-32B-Preview已在魔搭社區(qū)和HuggingFace等平臺(tái)上開源。發(fā)布短短幾小時(shí)，引起全球開發(fā)者熱情體驗(yàn)。有開發(fā)者認(rèn)為該模型“是完全沒有預(yù)料到的瘋狂的躍進(jìn)”、“今年開源領(lǐng)域最重大的突破”、“讓中國(guó)在開源大模型和AI推理上占據(jù)先機(jī)”。通義團(tuán)隊(duì)透露，盡管QwQ展現(xiàn)了強(qiáng)大的分析能力，但該模型仍是個(gè)供研究的實(shí)驗(yàn)型模型，存在不同語(yǔ)言的混合使用、偶有不恰當(dāng)偏見、對(duì)專業(yè)領(lǐng)域問題不了解等局限。隨著研究深入模型迭代，這些問題將逐步得到解決。

Tags:

深度學(xué)習(xí) 阿里模型

相關(guān)推薦

免責(zé)聲明: 本文所包含的觀點(diǎn)僅代表作者個(gè)人看法，不代表新火種的觀點(diǎn)。在新火種上獲取的所有信息均不應(yīng)被視為投資建議。新火種對(duì)本文可能提及或鏈接的任何項(xiàng)目不表示認(rèn)可。交易和投資涉及高風(fēng)險(xiǎn)，讀者在采取與本文內(nèi)容相關(guān)的任何行動(dòng)之前，請(qǐng)務(wù)必進(jìn)行充分的盡職調(diào)查。最終的決策應(yīng)該基于您自己的獨(dú)立判斷。新火種不對(duì)因依賴本文觀點(diǎn)而產(chǎn)生的任何金錢損失負(fù)任何責(zé)任。

推理水平對(duì)標(biāo)OpenAIo1！阿里云通義開源最新推理模型QwQ

周鴻祎：大模型將重構(gòu)每個(gè)行業(yè)，加速智能化到來(lái)

AI大模型加速落地，阿里云持續(xù)「滋養(yǎng)」

英偉達(dá)JimFan：復(fù)刻N(yùn)LP的成功路，用通用模型開啟具身智能的GPT-3時(shí)刻

阿里云智能對(duì)話機(jī)器人英文名更名為Chatbot

百度千帆大模型平臺(tái)日均調(diào)用量超7億次

熱門文章