股票分析師的一天通常從幾百條公司新聞開始。這些內容分散在多個平臺,讀一遍不現實,跳過去又怕漏掉影響判斷的關鍵資訊。喬治華盛頓大學 2023 年秋季的一篇 arXiv 論文,試圖回答一個很實際的問題:大語言模型能不能替人把這活幹了?
一個由公開資料搭起來的實驗
研究的路子並不複雜,但每一步都踩在真實場景上。他們用 News API 抓取上市公司新聞,從 Wikipedia 取公司背景,再拉取 Yahoo Finance 的股價資料,覆蓋了 AAPL、MSFT、GOOGL、AMZN 等十家大型公司。
一個細節值得留意:LLM 本身不擅長直接處理數字表格。研究者寫了一個簡單的模板,把股價漲跌、成交區間等資料轉換成自然語言描述,再餵給模型。這個思路很務實,等於是給模型鋪了一條理解數值資訊的捷徑。
兩類摘要流程,三個開源模型
實驗對比了兩種摘要組織方式:Summarize Chains(按順序逐條摘要並彙總)和 檢索增強生成(RAG),後者用 FAISS 做向量檢索。模型方面則選了三款開源模型——Falcon-7B-Instruct、DistilBART-CNN-12-6 和 BART-Large-XSum,股票摘要另用 GPT-3(text-davinci-003)生成。
結果很清楚:Falcon-7B 配合 Summarize Chains 效果最好,事件覆蓋準確,文字也連貫。相比之下,RAG 在理論上很有吸引力,實際跑起來卻暴露了明顯缺陷——當檢索數量 k 增大時,Falcon 出現嚴重重複,BART-Large-XSum 甚至開始編造事實。這種幻覺現象在小模型上尤其明顯。
RAG 原本是想給模型提供更多上下文,結果反而是「喂太多」把模型帶偏了。
一個被反覆驗證的教訓
論文還做了一個基礎對照:直接取新聞前幾句的 Lead-3 基線。結果顯示,兩種 LLM 方法在 ROUGE-1 指標上都明顯壓過基線,說明即便存在幻覺問題,大模型自動摘要仍然比「擷取開頭」更接近人工總結。
這個研究的價值不在於展示了多驚豔的準確性,而在於它記錄了失敗模式。論文寫於 2023 年,那時 RAG 在金融場景還沒有普及,但之後大量金融摘要工具都走了類似路線。「檢索越多,幻覺越重」這個現象,對今天仍在用中小模型做 RAG 的開發者來說依然有參考意義。
值得關注的幾個要點
- 模型越大不一定是關鍵,流程設計(如 Summarize Chains)對結果影響更直接。
- RAG 的檢索數量需要謹慎調參,盲目增加上下文反而可能降低輸出質量。
- 把結構化資料預處理成自然語言模板,是讓 LLM 理解金融資料的有效手段。
論文還附帶了一個 Streamlit 儀表盤,用於互動式股票資料視覺化。雖然這更像是研究配套,但說明實驗整體把「可用性」也考慮進去了。作為 2023 年的早期實證,它倒是給後來者留下了一組相當誠實的試驗記錄。











評論
暫無評論
成為第一個評論的人