返回資訊
RSS 採集arxiv.org

StatFormBench評估大模型的統計問題構造能力

內容摘要

研究人員推出StatFormBench,評估大型語言模型能否由非正式統計目標及異構數據推斷分析任務和相關變數。基準包含1,013個樣本,涵蓋85個細粒度類別,並測試14個開源及閉源模型。最佳零樣本結果的細粒度分類準確率為72.0%,變數集合重疊率為63.2%。