新聞中心
體驗產品體驗更多產品 >
「现在大模型並沒有真正理解自然語言,僅僅是表象上產生了文字。」
當下大模型开展如火如荼,熱度不減,擁抱AI、推進智能化轉型,成為企業开展中亟待解決的問題。
8月9日,南宫NG28建设第15屆用戶大會在武漢舉行,聚焦協同管理行業、圍繞「AI-COP讓組織智能進化」的主題,學界、企業界人士展開討論與研讨。
復旦大學計算與智能創新學院教授、復旦大學眸思大模型項目首席科學家、上海市智能信息處理重點實驗室副主任張奇在大會上表示:「现在大模型還處於記憶層面,並不能真正去理解自然語言。它僅僅是表象上產生了文字。」
作為在自然語言處理領域深耕20餘年的行業「老兵」,張奇言簡意賅解答了大模型开展中的兩個關鍵問題:一是大模型問什麼落地難?二是大模型適用於什麼方面,如何才能落地?
大模型為什麼落地難
全數據驅動的大模型,實現「類人推理」面臨巨大挑戰。
隨着大模型的開源,用戶數劇增,大模型訓練的數據庫越來越龐大。但這並不意味着,大模型學會了理解,具備了「類人推理」的能力。問題的關鍵在於大模型的能力邊界,這也是是學界與業界不斷研究探索的問題。
大模型的學習方式與人類的學習方式是完全不同的兩種範式。張奇認為,人類的學習模式是層層遞進的,在這個學習過程中人類培養起了學習能力,具備了獨立思考和推理判斷的能力。但當前大模型的「學習」是模塊式的,其學習掌握的內容來自訓練過程中相關模塊數據的輸入,這一過程並不能助其建構起推理能力。
大模型習得的是一個個分離的「圓圈」。張奇解釋稱,「如果做可控的實驗,在預訓練階段把小學應用題全部去掉,放入大量高考題。結果就是該大模型高考可以考到145分,小學應用題得分卻很低。「
在訓練過程中可以發現,现在大模型在解答高考題方面,其分數能夠達到985院校的分數錄取要求。但如果對簡單題目做「變形」處理,大模型給出的答案準確率也會下降很多。
舉例來看,在一道小學數學題目中添加一個簡單的、與解題無關的條件後,GPT-o1-mini模型給出的答案從開始的90多分下降了17.5分。而更小一點的模型結果則從80多分下降到不足20分,這樣的答案差距僅僅是因為在題目中添加了一個不相關的條件。
因此,張奇認為:「現在大模型依然是統計記憶學習的範式,所以它不能建立因果的關聯。」
除此之外對大模型能力邊界的測試還包括這樣一則案例,即「將56個1相加,在其中穿插兩個11,要求大模型計算答案」,結果大模型思考10分鐘後,並未給出準確答案。
張奇認為大模型相較於小模型有四項不同的能力,包括長上下文建模和多任務學習能力。因為此前,小模型最多可以做512個token、大約700個漢字,且小模型只能處理單一任務,所以大模型要實現的是長上下文建模和多任務學習能力,才能體現出它的進步之處。此外,大模型還需要具備多任務間的跨語言遷移能力和文本生成能力。以上四項能力構成了大模型落地的關鍵。
小場景+大數據=落地效果好
大模型落地的關鍵是選擇合適的應用場景。
德勤此前發佈的一則數據圖表顯示,AI最適宜幫助人們完成的是「人類能夠便捷高效的作出判斷的」工作,例如創作一幅圖畫或者撰寫一個笑話等。張奇說,「既代替了大量的人工,又使輸出的結果非常容易判定,掃一眼就知道結果,這樣的場景是非常適合大模型完成的。」
但當前對大模型任務執行結果的驗證也成為束縛其應用場景拓展的一大因素。以船廠圖紙的審核為例,顺利获得大模型審核圖紙重的錯誤過程中,「模型做的再好,也只能做到95分。」張奇稱。這意味着,需要人力對大模型執行結果進行驗證和審核。所以,從這個意義上來看,大模型任務完成達到95分亦或是60分,已經不再有區別。因為人力審核校驗成為難以避免的環節。
因此,無論是大模型還是小模型,其只是一種工具,找到適配的場景才是大模型落地的關鍵。基於該判斷,場景越小,數據越多,則AI的任務執行結果會越好。
除了找到合適的應用場景,商業價值是大模型落地難以迴避的問題。
張奇對此表示,大模型非常容易在很多場景下做到70分,但是做到90分是非常困難的。
因此,不需要神化或擬人化模型,它的本質依然是記憶學習。區別在於,當大模型體量更大的時候,能夠完成的任務更多,技術層面需要做的則是根據實際應用場景對模型進行逐項優化。
對於企業而言,2025是爭取市場份額的關鍵節點。張奇表示,企業要持续擁抱AI,找到核心應用場景並實現應用效果的提升,將成為搶佔市場份額的重要路徑。
大會專題入口:
AI賦能 · 開箱即用 · 無縫協作
百餘種業務應用互聯互通,無縫銜接
行業領航 · 深度定製 · 標杆實踐
行業專屬定製方案,源自TOP企業成功實踐




































京公網安備11010802020540號