Automated Summarization of Financial News Using Large Language Models and Retrieval-Augmented Generation: An Early Empirical Study (Fall 2023): 用 LLM 處理海量財經資訊

Automated Summarization of Financial News Using Large Language Models and Retrieval-Augmented Generation: An Early Empirical Study (Fall 2023): 用 LLM 處理海量財經資訊

Marcus Chen
147
original

喬治華盛頓大學的一項早期研究驗證了用大語言模型自動摘要金融新聞的可行性,對比了兩類摘要流程和多個開源模型,發現 Falcon-7B 配合 Summarize Chains 效果最佳,而 RAG 在小模型上容易產生重複和幻覺。

股票分析師的一天通常從幾百條公司新聞開始。這些內容分散在多個平臺,讀一遍不現實,跳過去又怕漏掉影響判斷的關鍵資訊。喬治華盛頓大學 2023 年秋季的一篇 arXiv 論文,試圖回答一個很實際的問題:大語言模型能不能替人把這活幹了?

一個由公開資料搭起來的實驗

研究的路子並不複雜,但每一步都踩在真實場景上。他們用 News API 抓取上市公司新聞,從 Wikipedia 取公司背景,再拉取 Yahoo Finance 的股價資料,覆蓋了 AAPL、MSFT、GOOGL、AMZN 等十家大型公司。

一個細節值得留意:LLM 本身不擅長直接處理數字表格。研究者寫了一個簡單的模板,把股價漲跌、成交區間等資料轉換成自然語言描述,再餵給模型。這個思路很務實,等於是給模型鋪了一條理解數值資訊的捷徑。

兩類摘要流程,三個開源模型

實驗對比了兩種摘要組織方式:Summarize Chains(按順序逐條摘要並彙總)和 檢索增強生成(RAG),後者用 FAISS 做向量檢索。模型方面則選了三款開源模型——Falcon-7B-InstructDistilBART-CNN-12-6BART-Large-XSum,股票摘要另用 GPT-3(text-davinci-003)生成。

結果很清楚:Falcon-7B 配合 Summarize Chains 效果最好,事件覆蓋準確,文字也連貫。相比之下,RAG 在理論上很有吸引力,實際跑起來卻暴露了明顯缺陷——當檢索數量 k 增大時,Falcon 出現嚴重重複,BART-Large-XSum 甚至開始編造事實。這種幻覺現象在小模型上尤其明顯。

RAG 原本是想給模型提供更多上下文,結果反而是「喂太多」把模型帶偏了。

一個被反覆驗證的教訓

論文還做了一個基礎對照:直接取新聞前幾句的 Lead-3 基線。結果顯示,兩種 LLM 方法在 ROUGE-1 指標上都明顯壓過基線,說明即便存在幻覺問題,大模型自動摘要仍然比「擷取開頭」更接近人工總結。

這個研究的價值不在於展示了多驚豔的準確性,而在於它記錄了失敗模式。論文寫於 2023 年,那時 RAG 在金融場景還沒有普及,但之後大量金融摘要工具都走了類似路線。「檢索越多,幻覺越重」這個現象,對今天仍在用中小模型做 RAG 的開發者來說依然有參考意義。

值得關注的幾個要點

  • 模型越大不一定是關鍵,流程設計(如 Summarize Chains)對結果影響更直接。
  • RAG 的檢索數量需要謹慎調參,盲目增加上下文反而可能降低輸出質量。
  • 把結構化資料預處理成自然語言模板,是讓 LLM 理解金融資料的有效手段。

論文還附帶了一個 Streamlit 儀表盤,用於互動式股票資料視覺化。雖然這更像是研究配套,但說明實驗整體把「可用性」也考慮進去了。作為 2023 年的早期實證,它倒是給後來者留下了一組相當誠實的試驗記錄。

金融新聞摘要LLM檢索增強生成RAG學術論文自動摘要Falcon-7B金融AI實證研究

分享

評論

0
0/500 字元

暫無評論

成為第一個評論的人

探索更多