NVIDIA がエージェント型コーディングのベンチマークで首位に立った。発生元は NVIDIA 公式1件に arXiv 4件が続く学術寄りの構成で、製品発表というより研究と評価が主導する動き――ベンチマーク上の順位という定量的な指標が起点になっている。コードを書くだけでなく、計画・実行・修正を繰り返す「エージェントとしての実装力」を測る土俵で、本流はモデル単体の生成品質から、長い工程を自律的に回す能力へ評価軸が移りつつある点にある。ただしベンチマーク首位は特定条件下での結果であり、実際の開発現場での有効性や再現性、他モデルとの差の持続性は、順位だけからは断定できない。
NVIDIA、エージェント型コーディングで首位
NVIDIA、エージェント型コーディングで首位
NVIDIA Achieves Leading Agentic Coding Performance on First Agentic AI Benchmark
NVIDIA、初のエージェント型AIベンチマークでコーディング性能首位を達成
学術(arxiv ほか) 58本 ▾
CORA、マルチモーダルRLVRの「思考と回答のずれ」を是正
Abstracting Cross-Domain Action Sequences into Interpretable Workflows
操作ログを解釈可能なワークフローへ抽象化する手法を提案
Zero-shot generalization of transformer neural operators to larger domains
Transformerニューラル演算子の大領域へのゼロショット汎化
From Chatbot to Digital Colleague: The Paradigm Shift Toward Persistent Autonomous AI
LLMが「チャットボット」から永続自律AIへ移行する転換を概念化
A Fixed-Point Neural Operator for Size- and Functional-Transferable Hamiltonian Prediction
サイズ・汎関数転移可能なハミルトニアン予測の固定点ニューラル演算子
EM-NeSy: Expectation Maximization for Neurosymbolic Learning
EM-NeSy、EM法でニューロシンボリック学習を一般化
A theoretical model for task routing in mixture-of-expert transformers
MoE Transformerのタスクルーティングを理論モデル化
Elastic Queries Reinforcement Learning: Self-Aware Policy Execution for VLA Models
VLAモデルの推論頻度を自律調整する「Elastic Queries RL」
ScoreGate、RAGの取得チャンク数を適応的に選択
Decoupled Mixture-of-Experts for Parametric Knowledge Injection
分離型MoEでパラメトリックな知識注入を改善
Implicit Reasoning for Large Language Model-based Generative Recommendation
暗黙的推論でLLMの生成的推薦を強化
Knowledge Graph Enhanced Memory-Augmented Retrieval for Long Context Modeling
知識グラフ強化の記憶検索で長文脈を一貫処理
Operadic consistency: a label-free signal for compositional reasoning failures in LLMs
LLMの合成推論の失敗をラベル不要で検出する「オペラド整合性」を提案
Valid Inference with Synthetic Data via Task Exchangeability
合成データで妥当な推論を保証するtask exchangeabilityを提案
Beyond Uniform Tokens: Adaptive Compression for Time Series Language Models
時系列LLMの非対称トークン圧縮で効率化、予測から異常検知まで有効
Beyond the Commitment Boundary: Probing Epiphenomenal Chain-of-Thought in Large Reasoning Models
思考連鎖に『コミットメント境界』、以降の手順は無影響と判明
単体制約スパースバギングSCSB、アンサンブルを最大96%圧縮し較正改善
Timeflies、未来の観測有無と値を同時推定する予測枠組み
A2D2: Fine-Tuning Any-Length Discrete Diffusion for Adaptive Decoding
A2D2、可変長離散拡散モデルの報酬誘導ファインチューニングを統一
NetCause: Counterfactual Learning for Root Cause Analysis in Large-Scale Networks
NetCause、反実仮想学習でクラウド網障害の根本原因を順位付け
Graphical Causal Reasoning for Root Cause Analysis in Cloud Networks
クラウド網障害の根本原因分析、因果グラフ探索で85.7%の再現率
GF-DiT: Scheduling Parallelism for Diffusion Transformer Serving
GF-DiT、拡散Transformer配信のGPU並列度を動的スケジューリング
Optical Implementation of Equilibrium Propagation Using Spatial Photonic Ising Machines
空間フォトニックイジングマシンで平衡伝播を光学実装
Accelerating Speculative Diffusions via Block Verification
拡散モデルに投機的復号のブロック検証を導入、受理率を理論的に改善
PolyFlow、多面体制約を埋込む射影不要のflow matching
MiniMax、超長文脈向けブロック疎注意MSAを発表
SmartFont: Dynamic Condition Allocation for Few-Shot Font Generation
SmartFont、大域と局所条件を多段配分する少数事例フォント生成
Hölder++: Improving the Quality-Coherence Trade-off in Multimodal VAEs
Hölder++、マルチモーダルVAEの品質と整合性の両立を改善
VideoMDM: Towards 3D Human Motion Generation From 2D Supervision
VideoMDM、3D正解データなしで動画の2D姿勢から3D動作生成を学習
SkillCAT: Contrastive Assessment and Topology-Aware Skill Self-Evolution for LLM Agents
SkillCAT、LLMエージェントのスキル自己進化を検証付き3段階に分離
SICI: A Semantic-Pragmatic Complexity Index Reveals Regime Shifts in LLM Stance Detection
意味・語用論的複雑性指標SICI、LLM立場検出のレジーム変化を解明
MiniPIC: Flexible Position-Independent Caching in <100LOC
MiniPIC、100行未満でvLLMに位置非依存KVキャッシュを実装
Reroute, Don't Remove: Recoverable Visual Token Routing for Vision-Language Models
Reroute、視覚トークンを除去でなく再ルーティングしVLM推論を効率化
Context-Driven Incremental Compression for Multi-Turn Dialogue Generation
C-DIC、多ターン対話の文脈を逐次圧縮し長対話を安定化
Doc-to-Atom: Learning to Compile and Compose Memory Atoms
Doc2Atom、文書を知識アトムに分解し合成的パラメトリック記憶を構築
System Report for CCL25-Eval Task 5: New Dataset and LoRA-Fine-Tuned Qwen2.5
PoetryQwen、CCPoetry-49Kで古典中国詩の鑑賞を専門化
TAHOE: Text-to-SQL with Automated Hint Optimization from Experience
Tahoe、経験からヒントを学びText-to-SQLを本番最適化
Breaking Entropy Bounds: Accelerating RL Training via MTP with Rejection Sampling
Bebop、棄却サンプリングでMTP受理率を改善しRL学習を加速
Latent World Recovery for Multimodal Learning with Missing Modalities
LWR、欠損モダリティ下で潜在世界を復元しマルチモーダル学習
CHORUS: Decentralized Multi-Embodiment Collaboration with One VLA Policy
CHORUS、単一VLA方策で分散的な多体協調を実現
ALIGNBEAM : Inference-Time Alignment Transfer via Cross-Vocabulary Logit Mixing
ALIGNBEAM、語彙を越えて安全アンカーのlogitを移植
Measuring Semantic Progress in Multi-turn Dialogue via Information Gain
多ターン対話の意味的進展を情報利得で測る指標を提案
Harness In-Context Operator Learning with Chain of Operators
CHOP、演算子連鎖で凍結ICONを分布外タスクへ汎化
Mathematical perspective on genetic algorithms with optimization guided operators
最適化誘導演算子を持つ遺伝的アルゴリズムの数理的視座
VIA-SD: Verification via Intra-Model Routing for Speculative Decoding
VIA-SD、モデル内ルーティングで投機的デコードを高速化
Re-evaluating Confidence Remasking in Masked Diffusion Language Models
拡散言語モデルの remasking 手法 WINO、再評価で効果は限定的
Can News Predict the Market? Limits of Zero-Shot Financial NLP and the Role of Explainable AI
ゼロショット金融NLPの限界、ニュースで株価予測は困難と示す
Adaptive Multi-Resolution Procedural Knowledge Compression for Large Language Models
SKIM、手続き的スキルを適応的多解像度で圧縮しコスト削減
A Resource for Enthymeme Detection in Controversial Political Discourse
論争的政治言説のエンチメーム検出データセットを公開
Fine-tuning Multi-modal LLMs with ART: Art-based Reinforcement Training
ART、視覚入力のみ最適化で凍結MLLMをソフトトークン微調整
MultiToP、視覚トークンを修復し動画LMMの幻覚を緩和
Fast Speech Foundation Model Distillation Using Interleaved Stacking
交互スタッキングで音声基盤モデルの蒸留学習を高速化