大型语言模型擅长处理自然语言,但现实世界的 AI 系统里其实大量使用机器可读的离散符号——比如用户 ID、商品 ID、状态码、结构化的事件标签。这些符号紧凑、保留任务相关结构,却天然落在 LLM 的词表之外。一篇新近上传到 arXiv 的论文直接点出这个矛盾,并给出一个名为 UniLang 的统一生成框架。
论文标题叫 “When Machines Speak”,看起来有点诗意,实际上讨论的是一个很工程的问题:能不能让预训练 LLM 不把结构化符号硬翻译成自然语言,而是直接把符号当成和单词一样的生成单元?作者给出的答案是:扩展词表。
核心思路:把符号“翻译”进词表
UniLang 的做法并不玄。它在原始 LLM 的 vocabulary 和 embedding space 上做扩展,把带 ground truth 的机器原生表示“注册”成新的词元。这样一来,文本 token 和符号 token 就可以在同一个自回归目标下被联合建模和生成,模型不再需要依赖任务特异的架构,也不需要先把符号转成自然语言(比如把商品 ID 写成“item number 3”)。
这个思路听起来简单,但关键在于“grounded”——扩展出来的符号表示不是随便加的,而是和实际任务中的实体、行为、结构信息绑定。这样才能让模型真正理解这些符号的语义,而不是把它们当乱码记下来。论文称这种方法为“first-class generative units”,也就是让机器符号在生成时享有和自然语言词平等的地位。
两场跨领域测试
为了证明 UniLang 不是只能在单一场景里玩得转,作者选了两个结构差异很大的预测任务:
- 序列推荐:根据用户历史行为序列,预测下一个交互的 item。这类任务中,用户 ID 和 item ID 都是典型的机器原生符号。
- 法律先例预测:根据法律案件的结构化信息,预测可能适用的先例。这里的符号更具层次性和领域性。
论文报告,UniLang 在这两个任务上都 持续优于强基线(作者原话是 “consistently outperforms strong baselines”)。注意这里没有给出具体提升幅度,毕竟摘要篇幅有限,但跨领域一致性的结果本身就说明框架有一定通用性。
为什么值得关注
把推荐系统、法律检索这类任务统一到大模型的生成框架里,并不只是为了省事。它可能意味着我们可以用同一套预训练权重,同时处理自然语言交互和结构化预测,而不用为每个任务单独设计输入输出头。对做实际 AI 系统的团队来说,这是一个值得跟踪的方向——尤其是当手头已有大量用符号编码的业务数据时。
当然,论文目前只是预印本,代码链接已在摘要中提供,但尚未见到完整开源细节。感兴趣的读者可以顺着 arXiv 页面找到作者和提交历史,后续是否有正式会议版本和更详细的评测,值得保持观察。
实用建议:如果你是做推荐、搜索或法律科技的工程师,可以下载 PDF 细看 embedding 扩展的具体实现;如果只是对大模型边界好奇,先记住 UniLang 这个名字即可——它代表了一类“把非语言模态塞进词表”的尝试,未来这类思路可能会越来越多。











评论
暂无评论
成为第一个评论的人