UniLang: 讓大模型把機器符號當語言生成

UniLang: 讓大模型把機器符號當語言生成

Nathan Reed
25
original

UniLang 是 arXiv 上最新提出的一種統一生成框架,通過擴充套件預訓練大語言模型的詞表,將離散的機器原生符號與自然語言 token 一起建模和生成,從而讓 LLM 直接處理結構化預測任務。論文在序列推薦和法律先例預測兩個任務上驗證了效果,為把大模型當作通用生成骨幹提供了新思路。

大型語言模型擅長處理自然語言,但現實世界的 AI 系統裡其實大量使用機器可讀的離散符號——比如使用者 ID、商品 ID、狀態碼、結構化的事件標籤。這些符號緊湊、保留任務相關結構,卻天然落在 LLM 的詞表之外。一篇新近上傳到 arXiv 的論文直接點出這個矛盾,並給出一個名為 UniLang 的統一生成框架。

論文標題叫 「When Machines Speak」,看起來有點詩意,實際上討論的是一個很工程的問題:能不能讓預訓練 LLM 不把結構化符號硬翻譯成自然語言,而是直接把符號當成和單詞一樣的生成單元?作者給出的答案是:擴充套件詞表。

核心思路:把符號「翻譯」進詞表

UniLang 的做法並不玄。它在原始 LLM 的 vocabulary 和 embedding space 上做擴充套件,把帶 ground truth 的機器原生表示「註冊」成新的詞元。這樣一來,文字 token 和符號 token 就可以在同一個自迴歸目標下被聯合建模和生成,模型不再需要依賴任務特異的架構,也不需要先把符號轉成自然語言(比如把商品 ID 寫成「item number 3」)。

這個思路聽起來簡單,但關鍵在於「grounded」——擴充套件出來的符號表示不是隨便加的,而是和實際任務中的實體、行為、結構資訊繫結。這樣才能讓模型真正理解這些符號的語義,而不是把它們當亂碼記下來。論文稱這種方法為「first-class generative units」,也就是讓機器符號在生成時享有和自然語言詞平等的地位。

兩場跨領域測試

為了證明 UniLang 不是隻能在單一場景裡玩得轉,作者選了兩個結構差異很大的預測任務:

  • 序列推薦:根據使用者歷史行為序列,預測下一個互動的 item。這類任務中,使用者 ID 和 item ID 都是典型的機器原生符號。
  • 法律先例預測:根據法律案件的結構化資訊,預測可能適用的先例。這裡的符號更具層次性和領域性。

論文報告,UniLang 在這兩個任務上都 持續優於強基線(作者原話是 「consistently outperforms strong baselines」)。注意這裡沒有給出具體提升幅度,畢竟摘要篇幅有限,但跨領域一致性的結果本身就說明框架有一定通用性。

為什麼值得關注

把推薦系統、法律檢索這類任務統一到大模型的生成框架裡,並不只是為了省事。它可能意味著我們可以用同一套預訓練權重,同時處理自然語言互動和結構化預測,而不用為每個任務單獨設計輸入輸出頭。對做實際 AI 系統的團隊來說,這是一個值得跟蹤的方向——尤其是當手頭已有大量用符號編碼的業務資料時。

當然,論文目前只是預印本,程式碼連結已在摘要中提供,但尚未見到完整開源細節。感興趣的讀者可以順著 arXiv 頁面找到作者和提交歷史,後續是否有正式會議版本和更詳細的評測,值得保持觀察。

實用建議:如果你是做推薦、搜尋或法律科技的工程師,可以下載 PDF 細看 embedding 擴充套件的具體實現;如果只是對大模型邊界好奇,先記住 UniLang 這個名字即可——它代表了一類「把非語言模態塞進詞表」的嘗試,未來這類思路可能會越來越多。

UniLang大語言模型機器原生符號結構化預測序列推薦法律先例預測統一生成框架LLM詞表擴充套件arxiv論文科研前沿

分享

評論

0
0/500 字元

暫無評論

成為第一個評論的人

探索更多

開源專案

Awesome AI for Science: 精選AI科學發現資源

這是一個精選AI工具、庫、論文、數據集和框架的倉庫,覆蓋物理、化學、生物學和材料科學。為研究人員和開發者提供快速掌握AI在科學探索中應用的價值資源。擁有超過1700顆星,採用MIT許可證。

awesome-ai-research-writing: AI 學術寫作資源精選

awesome-ai-research-writing 是 GitHub 上一個聚焦 AI 研究寫作的資源精選列表,幫助研究者快速找到工具、模板和技巧,減少論文潤色的重複勞動。倉庫已有超過 3.3 萬 Star,社羣關注度高,適合科研人員和學生收藏。

earth2studio: NVIDIA 面向天氣與氣候的深度學習框架

earth2studio 是 NVIDIA 開源的一個深度學習框架,專為天氣和氣候領域設計。它簡化了從研究到部署的完整工作流,提供通用 API 和預訓練模型,幫助研究人員快速構建 AI 驅動的天氣預報和氣候模擬應用,降低開發門檻並加速領域創新。

ai4paper: 面向研究者的開源AI學術平臺

ai4paper是一個面向研究人員的開源AI平臺,聲稱可訪問2.4億篇學術論文。其核心功能包括全文PDF翻譯、AI驅動的文獻搜索和一鍵生成評論,通過網頁界面即可使用,無需安裝插件。該平臺還支持Zotero集成,並可通過小程序訂閱期刊,旨在提升文獻綜述和學術寫作的效率。項目主要使用HTML編寫,採用MIT許可證,截至採集時在GitHub上獲得2739個星標。

openscience: 面向科學研究的開源 AI 工作臺

openscience 是一個由 synthetic-sciences 開源的 AI 工作臺,專為科學研究場景設計。專案使用 TypeScript 構建,在 GitHub 已獲超 3.2k 星標,倉庫包含前後端、CLI 和評估模組。目前公開文件有限,適合對 AI for Science 感興趣的團隊關注。

ResearchStudio: 微軟開源AI協作研究工具

ResearchStudio 是微軟發布的開源 AI 協作工具,旨在支持研究人員從問題提出到最終發表的完整學術旅程。它集成了文獻綜述、實驗設計、數據分析和論文寫作等功能,並利用大型語言模型提供智能建議。該項目特別適合希望優化工作流程的學術研究者。主要程式語言為 Python,採用 MIT 許可證,採集時 GitHub 星標數為 1911。