RAG まわりの焦点が、検索の強化から「答えが根拠に忠実か」を測る側へ寄った週。評価基盤が実装に先行している。
Apple の機械学習研究と arXiv 計算機科学系の 2 系統で、8/27〜28 に 5 本が並んだ。Apple は根拠ある回答のルーブリック整合と、LLM の確率的信念の内部不整合の定量化。arXiv 側は時系列知識ベース上の Q&A、世界モデルの確率的整合、少軌跡で学習する SWE エージェントが続いた。
共通するのは、検索や生成そのものより「答えが根拠に忠実で内部矛盾がないか」を測る側の整備だ。手法 1 本に対しベンチマーク・診断が 3 本という構成は、研究先行で採用が追いついていない段階を示す。※トピック名は開発者ツール寄りだが、確認できた 5 本は評価側に偏り、製品への実装は確定していない。
これらのベンチマークが発表元の外で使われ始めるか、公式発表や専門報道が付くか。とくに少軌跡学習の SWE エージェントが実際の開発支援ツールへ降りるかが分岐点になる。