RSS 採集arxiv.org
StatFormBench評估大模型的統計問題構造能力
內容摘要
研究人員推出StatFormBench,評估大型語言模型能否由非正式統計目標及異構數據推斷分析任務和相關變數。基準包含1,013個樣本,涵蓋85個細粒度類別,並測試14個開源及閉源模型。最佳零樣本結果的細粒度分類準確率為72.0%,變數集合重疊率為63.2%。
經您同意後,我們會使用 Google Analytics 了解頁面瀏覽及關鍵流程是否成功。我們不會傳送 Prompt、檔案、帳戶識別資料、模型識別資料、餘額、費用或原始錯誤。 私隱政策