Trust, but Don't Verify: Epistemic Blind Spots in LLM Source Evaluation
言語モデルが複数の出典を統合するとき、数値の妥当性を実際に評価するかを調べた実験研究。
著者・制作者: Rohan N. Pradhan, Steve Goley
確認日: 2026-08-01
出典メモ: 2026年7月改訂の新しいプレプリント。統制された課題で特定の失敗を示すが、追試とより広い外部検証が必要。
この出典につながる主張
- モデルは捏造統計を単独では検出したが、複数出典の統合時にはその能力を安定して使えなかった。