首頁 > AI資訊 > 最新資訊 > 商湯大模型的「5o」交互,普通人如何和AI過一天?

商湯大模型的「5o」交互,普通人如何和AI過一天?

新火種    2024-08-22

「」在剛剛結束的堪稱「AI 界春晚」的世界人工智能大會(WAIC 2024)上,「中國版GPT-4o」亮相,它是來自商湯科技發布的“日日新5o”——國內首個「流式交互」多模態大模型。

在商湯的演示下,日日新5o擁有像人一樣的實時視覺能力,可以跟人進行流暢的視頻交互——能聽、能說、能看、無延時,它可以通過攝像頭+語音實現和用戶的實時交互,并獲知用戶所在的真實場景下的各種狀態信息,打破了與AI交互的次元壁,實現了與AI的“視頻通話”,已經具備真人聊天般的交互體驗。

兩個月前OpenAI推出了GPT-4o,以突破性的智能交互能力,徹底顛覆了我們對AI語音助手的認知,顛覆了過去的人機交互,給業界帶來又一次震撼。

震撼之外,中國大模型界對GPT-4o的認知似乎并不如GPT-4那么統一,有人認為「在實現AGI的路上,GPT-4o并不重要」、有人評價「在技術突破上,GPT-4o沒那么驚艷」;有人認為GPT-4o的發布是 AI 2.0 時代的標志性事件,會催生全新的應用平臺和商業模式。

帶來的共識是,多模態可能引領新的交互模式和產品創新,多模態大模型開始成為國內大模型競爭的下一個焦點。

然而,在國內GPT-4o似乎并未成為引領多模態競爭的產品形態時,兩個月后商湯率先推出了「中國版GPT-4o」日日新5o大模型,商湯用行動力證明了對GPT-4o的判斷。

正如商湯 CEO徐立在WAIC 2024上所講的:「行業要變化,交互模式一定是先行的」,解釋了商湯為什么要做「中國版GPT-4o」,首創流式交互大模型。

1 大模型可以是每個人的貼身AI全能助手

如果你擁有一個能看(現實世界)、能聽(讀懂指令)、能說(回答問題)的貼身 AI 助手,將會是一種什么體驗?

這位貼身助手,擁有豐富的多領域知識,包括生活、學習、工作各方面的知識,關鍵還能看懂現實世界——攝像頭就是它獲取現實世界影像的眼睛,而視覺觸及到的信息,它能立馬進行分析、總結,通過實時對話,像面對面聊天一樣,立即告訴你問題的答案,沒有延遲和拒絕。

早上起來,準備出門,你想知道現在外面的天氣應該做哪些準備,日日新5o可以準確地描述出外面的天氣狀況,并給出外出準備的建議:

走到一處很美的地方,你想拍照,但是不知道用什么姿勢拍出來好看,日日新5o開始充當一個攝影助手,它會指導你如何根據當前景色擺姿勢動作、注意光線等等技巧:

晚飯是一頓燒烤,大家一起搭起炭火爐、燃起炭火準備燒烤,日日新5o能準確地知道視頻里的人們正在干嘛,而且還能告訴詳細的戶外燒烤注意事項:

你想知道每種食材分別要如何燒烤才好吃,此時日日新5o化身為一名擁有多年烹飪經驗的燒烤大師,它能分辨出每種食材、要如何烤:

回到酒店,你看到一袋咖啡,詢問日日新5o后它能識別出這是咖啡粉而不是速溶咖啡,并告訴你咖啡粉對應的沖泡步驟,宛如一個咖啡師:

日日新5o不僅擁有大量、多領域的生活方面的知識,在日常生活場景中分別充當了發型助手、攝影師、燒烤大師、咖啡師……在職場工作環境中,也是一把好手,比如能迅速地總結出這本書該頁講了什么知識。比人的反應、分析、總結速度快多了:

面對一張手寫的字條或詩句,它也能立馬回答出它的意思和出處:

還能根據前三個字,準確預測出整個成語是什么:

從以上可以看到,日日新5o具備非常豐富的多領域知識,相比其他AI助手,它能看、能聽、能讀,首創的實時流式交互方式,使其具備真人般的交流對話;能精準地分析、辨別、總結出所「看到」的環境信息,在我們的生活、學習、工作中可以扮演多種助手角色,完全可以充當一款 AI 全能助手。

2 重塑交互的意義

日日新5o能作為一款表現出色的 AI 全能助手,除了展示出了它對標GPT-4o的各種能力:能看到那個現實世界,包括人、物、文字等符號;能聽懂用戶的話語,并根據其中的指令對現實世界進行識別,再反饋給用戶;能看書識字,概括總結所講的內容……

最大的變革就是交互模式的變化:國內首個流式交互多模態大模型。商湯將流式交互融入到大模型中,給用戶帶來真人般的交流體驗,讓日日新5o系統更像人。

我們知道,在人工智能發展中,ChatGPT之所一炮而紅,便是因為它開始展露出人類所具備的自主學習、分析、總結能力以及邏輯能力,而讓大模型像人一樣交流,正如引言所說,交互模式先行似乎并不是業界共識。

而商湯的日日新5o的發布,正是符合商湯對AI 2.0時代的判斷,正如CEO徐立所說:行業要變化,交互模式一定是先行的。

在徐立看來,變化是指能定義AI 2.0時代的「超級時刻」,正如iPhone時刻定義了移動互聯網的變化。而超級時刻需要一個超級應用,即便是像ChatGPT、Sora都還沒有到超級時刻,是因為它們沒有真正走進到一個行業的垂直應用中、引起廣泛變化。

走向應用,商湯認為需要有幾個核心的重點突破:

第一個就是實時的交互性能帶來流暢的用戶體驗,這是推動超級時刻以及應用爆發的一個核心。

第二是構建高階思維邏輯的合成數據,來提升模型的智力。

最后,不管是文本、圖像、視頻,如果對它沒有可控性,那么它們作為一個工具,本身帶來的效能提升就非常有限。

大模型本質上是做記憶的事情,記住世界的知識,就能回答的更準確,在徐立看來,它僅有的一點智力來自于對知識背后的高階的思維邏輯的記憶,所以,在垂直行業里面怎么構造高階思維邏輯的合成數據,往往是制勝的關鍵,并且是差異化的關鍵,也是中國人工智能之路的關鍵。

商湯最新發布的日日新5.5基座模型,便用了大量的合成、高階思維鏈的數據,把模型能力平均提升了30%。

商湯大模型的「5o」交互,普通人如何和 AI 過一天?

商湯CEO徐立認為,如果要推動人工智能超級時刻的到來,需要大模型可以展現出卓越的深度思考的能力。那么合成的人工數據,特別是高階思維的數據往往是非常重要的。所以越是有應用的場景,才能形成更好的高質量的數據的一些核心。

過去垂直領域是依賴人去構建更加高級的思維鏈數據,但是商湯認為,往前一步,不應該依賴人,而是應該通過跟真實世界的交互形成執行數據,去做推理。

因此,基于基座模型日日新5.5,商湯研發了日日新5o流式交互多模態大模型,在攝像頭不停地移動過程中、跟真實世界互動獲取更多新的信息,去進行推理、再得出反饋。

日日新5o的各種功能離不開基座模型日日新5.5的支撐。今年4月發布的日日新5.0是國內首個對標GPT-4 Turbo的大模型,經過兩個多月技術迭代,日日新5.5實現了多項功能升級,在數學推理、英文能力、指令跟隨等能力上明顯增強,交互效果和多項核心指標可比肩GPT-4o。

徐立認為,如果能把這種流式交互多模態大模型置入眼鏡、手機、電腦等端側設備,可能會推動一些應用的爆發。

商湯大模型的「5o」交互,普通人如何和 AI 過一天?

相關推薦
免責聲明
本文所包含的觀點僅代表作者個人看法,不代表新火種的觀點。在新火種上獲取的所有信息均不應被視為投資建議。新火種對本文可能提及或鏈接的任何項目不表示認可。 交易和投資涉及高風險,讀者在采取與本文內容相關的任何行動之前,請務必進行充分的盡職調查。最終的決策應該基于您自己的獨立判斷。新火種不對因依賴本文觀點而產生的任何金錢損失負任何責任。

熱門文章