NVIDIA が AR グラスや XR デバイス向けのエージェント基盤を公開し、Hugging Face のロボット連携や DeepMind のエージェント安全化と足並みがそろった。発生元は5件すべてが公式・プラットフォーム側で、学術やコミュニティの反応はまだ薄い――研究が降りてきた週というより、基盤ベンダー各社が「XRと身体性を持つエージェント」に向けて土台を並べ始めた週だ。話題の中心はモデルの賢さより、デバイス上でエージェントをどう動かし守るかという実装層にある。ただし現時点は発表とSDK提示が主で、実機採用の広がりは次段階の確認点になる。
NVIDIA、AR/XR向けエージェント基盤を公開
NVIDIA、AR/XR向けエージェント基盤を公開
Building AI Agents for AR Glasses and XR Devices with NVIDIA XR AI
NVIDIA、ARグラス/XR向けAIエージェント構築基盤「XR AI」を発表
Show HN: Are You in the Weights?
Show HN『Are You in the Weights?』、LLMがあなたを認識するか測定
かんぽ生命、AIで営業支援 “郵便局での一言”拾って保険提案へ 寸劇で分かる活用例
かんぽ生命、AIエージェントで営業支援を本格化
From the Hugging Face Hub to robot hardware with Strands Agents and LeRobot
Strands AgentsとLeRobot、Hugging Faceのモデルをロボット実機へ
「ポケカ対戦AIエージェント」開発コンテスト開始 「不完全情報ゲーム」をどう制するか
ポケモンカード対戦AIエージェントの開発コンテスト開始、不完全情報ゲームに挑む
Agentic Resource Discovery: Let agents search
Hugging Face、エージェントが自ら資源を探索する手法を提案
GitLab、AIエージェント向けの次世代Git互換ソースコード管理サービス「Project Switch」発表。最大で50倍高速かつ半分のトークンで利用可能に
GitLab、AIエージェント向けGit互換管理サービス「Project Switch」発表
Simon Willison、llama.cpp 開発者 Georgi Gerganov の発言を引用紹介
How to Optimize Transformer-Based Models for Low-Precision Training
NVIDIA、Transformer モデルの低精度学習を最適化する解説記事を公開
Securing the future of AI agents
Google DeepMind、AI エージェントを守る AI Control Roadmap を提示
NVIDIA Blackwell Tops MLPerf Training 6.0 with Industry-Leading Scale and Performance
NVIDIA、Blackwell が MLPerf Training 6.0 で首位と発表
Stack Overflow、AIエージェント同士が掲示板で技術情報を共有する「Stack Overflow for Agents」ベータ公開
Stack Overflow、AIエージェント向け情報共有サービスをベータ公開
Building llm-driven “ai” still requires domain knowledge
LLM駆動ツール開発でもドメイン知識の言語化が不可欠と論じる
Sakana AI、初の商用プロダクト「Marlin」リリース その実力は?【出力レポート全文掲載】
Sakana AI、初の商用プロダクト「Sakana Marlin」を提供開始
Why AI hasn’t replaced software engineers, and won’t
「AIはソフトウェア技術者を代替しない」と論じるエッセイ
学術(arxiv ほか) 130本 ▾
Multi-LCB: Extending LiveCodeBench to Multiple Programming Languages
LiveCodeBを多言語に拡張したコード評価ベンチMulti-LCB
Probe-and-Refine Tuning of Repository Guidance for Coding Agents
コーディングエージェント向けにリポジトリ指示文を調整する手法
Entropy Estimation in Multi-Qutrit Systems via Variational and Classical Neural Networks
変分量子アルゴリズムとCNNでマルチqutritのエントロピー推定
Scalable Training of Spatially Grounded 2D Vision-Language Models for Radiology
放射線科向け空間接地VLMの大規模学習とデータセットRefRad2D
Judging to Improve: A De-biased VLM-as-3D-Judge Protocol for Single-Image 3D Generation
脱バイアスのVLM3D判定器で単一画像からの3D生成を専門化
SoftSkill: Behavioral Compression for Contextual Adaptation
文脈適応のための行動圧縮手法SoftSkill
LLM推論で信頼できない知識の衝突を明示的に解消する手法
SPOT-E: Test-Time Entropy Shaping with Visual Spotlights for Frozen VLMs
凍結VLM向けの視覚スポットライトによるテスト時エントロピー整形SPOT-E
開かれた文献環境でのエージェント論文探索ベンチScholarQuest
ストリーミングRAGでツール先行実行が効く条件を特徴づける
IHUBERT: Vector-Based Semantic Deduplication and Domain-Balanced Pretraining for Persian Resources
ペルシャ語向け意味的重複除去とドメイン均衡事前学習のIHUBERT
Generative Engine Optimization at Scale: Measuring Brand Visibility Across AI Search Engines
AI検索エンジン全体でブランド可視性を測る生成エンジン最適化
Think Again or Think Longer? Selective Verification for Budget-Aware Reasoning
予算を意識した推論に向けた選択的な検証手法を提案
CombEval: A Framework for Evaluating Combinatorial Counting in Large Language Models
LLMの組合せ計数能力を評価する枠組みCombEvalを提案
AgentFinVQA: A Deployable Multi-Agent Pipeline for Auditable Financial Chart QA
監査可能な金融チャートQA向け多エージェントAgentFinVQA
NRITYAM: Language Models Meet Art and Heritage of Dance
世界の舞踊文化でLMの文化理解を測るベンチマークNRITYAM
自律コーディングエージェントで企業データを解釈・問い合わせ
Explaining Attention with Program Synthesis
プログラム合成で注意機構を説明し解釈可能性を追求
Enhancing Decision-Making with Large Language Models through Multi-Agent Fictitious Play
マルチエージェントの架空プレイで LLM の意思決定を強化
Optimal scenario design for climate emulation
気候エミュレーションの精度を高める最適シナリオ設計を提案
VLA モデルは常識を保持しているか、知識保持度を測る研究
Trade-offs in Medical LLM Adaptation: An Empirical Study in French QA
医療 LLM のドメイン適応、仏語 QA で利点と代償を実証研究
OneCanvas: 3D Scene Understanding via Panoramic Reprojection
OneCanvas、パノラマ再投影で VLM の 3D シーン理解を実現
Transformer Geometry Observatory TGO-I: Spectral Geometry Observatory
TGO-I、スペクトル幾何で Vision Transformer の内部構造を解析
TxBench-PP: Analyzing AI Agent Performance on Small-Molecule Preclinical Pharmacology
TxBench-PP、小分子前臨床薬理での AI エージェント性能を評価
RECOM、自動評価指標の妥当性と識別性のトレードオフを分析
遅延・誤作動 AEB 事象を学習注釈、極端な不均衡に対応する実用系
単眼姿勢推定を HIL/VIL 検証、艦上 UAV の自律飛行へ
User as Engram: Internalizing Per-User Memory as Local Parametric Edits
ユーザー記憶を局所的なパラメータ編集として内在化する手法
IndicContextEval、音声 LLM の文脈活用を 8 印度語で評価
Complementary Attention Head Pruning for Efficient Transformers
相補的な注意ヘッド剪定で Transformer を効率化
A Technical Taxonomy of LLM Agent Communication Protocols
LLM エージェントの通信プロトコルを技術的に分類・整理
Towards an Agent-First Web: Redesigning the Web for AI Agents
エージェント優先の Web へ、AI 向けに Web を再設計する提案
RODS: Reward-Driven Online Data Synthesis for Multi-Turn Tool-Use Agents
RODS、報酬駆動のオンラインデータ合成で多ターンツール利用を強化
Where Did the Variability Go? From Vibe Coding to Product Lines by Regeneration
Vibe コーディングの多様性はどこへ、再生成で製品ライン化
A Hybrid LSTM--Vision Transformer Architecture for Predicting HRRR Forecast Errors
LSTM と ViT の融合で高解像度数値予報 HRRR の誤差を予測
Spotlight: Synergizing Seed Exploration and Spot GPUs for DiT RL Post-Training
Spotlight、シード探索とスポット GPU で DiT の RL 事後学習を低コスト化
TRAP: Benchmark for Task-completion and Resistance to Active Privacy-extraction
TRAP、課題遂行とプライバシー抽出耐性を測るエージェント評価
時系列を直接埋め込み時系列質問応答を高めるTSQA手法
CAPRA: Scaling Feedback on Software Architecture Deliverables with a Multi-Agent LLM System
ソフト設計成果物の添削を自動化するマルチエージェントLLM「CAPRA」
GraphPO: Graph-based Policy Optimization for Reasoning Models
推論モデル向けグラフベース方策最適化「GraphPO」
RTSGameBench: An RTS Benchmark for Strategic Reasoning by Vision-Language Models
視覚言語モデルの戦略的推論を測るRTSベンチマーク
Decoupling Search from Reasoning: A Vendor-Agnostic Grounding Architecture for LLM Agents
検索と推論を分離するベンダー非依存のLLMエージェント基盤
SciRisk-Bench: A Risk-Dimension-Aware Benchmark for AI4Science Safety
AI for Scienceの安全性をリスク次元別に測る「SciRisk-Bench」
REVES: REvision and VErification--Augmented Training for Test-Time Scaling
逐次修正によるテスト時スケーリングを強化する「REVES」
GateMem: Benchmarking Memory Governance in Multi-Principal Shared-Memory Agents
多主体共有メモリのガバナンスを測る「GateMem」
LegalWorld: A Life-Cycle Interactive Environment for Legal Agents
法務エージェント向けライフサイクル型環境「LegalWorld」
Attention as Frustrated Synchronization
注意機構を「フラストレートした同期」として捉える理論
ForecastBench-Sim: A Simulated-World Forecasting Benchmark
模擬世界で予測力を測る「ForecastBench-Sim」
幅可変Transformer、層ごとに幅を変え22%省FLOPs
ReproRepo: Scaling Reproducibility Audits with GitHub Repository Issues
ReproRepo、GitHub課題で再現性監査をスケール
EvolveNav: Proactive Preflection and Self-Evolving Memory for Zero-Shot Object Goal Navigation
軌跡記憶を自己進化させるゼロショット物体探索ナビゲーションを提案
Adaptive Volumetric Mechanical Property Fields Invariant to Resolution
AdaVoMP、3D物体の力学特性場を解像度不変に予測
Learning Red Agent Policy from Observations for Neurosymbolic Autonomous Cyber Agents
観測から赤エージェント方策を学ぶ自律サイバー防御
Looped World Models、反復的潜在精緻化で深さと効率を両立
Fixed-Point Reasoners: Stable and Adaptive Deep Looped Transformers
ループ型Transformerの信号伝播問題を改善する手法FPRMを提案
RubricsTree、個人健康エージェントの開放型評価を拡張
Learning from the Self-future: On-policy Self-distillation for dLLMs
拡散LLM向けのオンポリシー自己蒸留OPSDを探究
DRFLOW: A Deep Research Benchmark for Personalized Workflow Prediction
個別化ワークフロー予測を測るDeep Researchベンチマークを提案
All Smoke, No Alarm: Oracle Signals in Agent-Authored Test Code
AIエージェント生成テストコードの検証力の弱さを分析した研究
WEQA: Wearable hEalth Question Answering with Query-Adaptive Agentic Reasoning
装着型健康データのQAを行うエージェント推論手法WEQAを提案
Memory as a Wasting Asset: Pricing Flash Endurance for Embodied Agents, and the Limits of Doing So
フラッシュ耐久を消耗資産として価格付けする実体エージェント論
Knowledge Reutilization in Meta-Reinforcement Learning
メタ強化学習で知識を再利用する転移フレームワークを提案
Ternary Mamba: Grouped Quantization-Aware Training of W1.58A16 State Space Models
Ternary Mamba、1.58ビット重みのQATで状態空間を量子化
HistoRAG、歴史方法論をRAGに組み込む批判的実践
医療AIの早期診断委譲と静かな幻覚を抑える多エージェント枠組み
PseudoBench: Measuring How Agentic Auto-Research Fuels Pseudoscience
PseudoBench、自律研究エージェントが擬似科学を助長する度合いを測定
Compositional Skill Routing for LLM Agents: Decompose, Retrieve, and Compose
LLMエージェント向け合成的スキルルーティング
ProvenanceGuard: Source-Aware Factuality Verification for MCP-Based LLM Agents
ProvenanceGuard、MCPエージェント向け出所考慮の事実検証
LoopCoder-v2: Only Loop Once for Efficient Test-Time Computation Scaling
LoopCoder-v2、一度のループで効率的テスト時計算スケール
Recursive Scaling in Masked Diffusion Models
マスク拡散モデルにおける再帰的スケーリングを検討
LLM Consumer Behavior Theory: Foundations of a Novel Research Field
エージェント市場の消費行動を扱う新研究領域LLM消費行動論を提唱
Dynamic Rollout Editing for Reducing Overthinking in RL-Trained Reasoning Models
動的ロールアウト編集でRL推論モデルの過剰思考を抑制
単調KAN、帰納バイアスとしての単調性を理論・実験で検討
GameCraft-Bench: Can Agents Build Playable Games End-to-End in a Real Game Engine?
GameCraft-Bench、実ゲームエンジンで遊べるゲームを作れるか
Environment-Grounded Automated Prompt Optimization for LLM Game Agents
環境に接地した自動プロンプト最適化でLLMゲームエージェント
From Drift to Coherence: Stabilizing Beliefs in LLMs
ドリフトから整合へ、LLMの信念を安定化
A Framework for Evaluating Agentic Skills at Scale
エージェントのスキルを大規模に評価する枠組み
Position: Coding Benchmarks Are Misaligned with Agentic Software Engineering
立場論文、コーディングベンチはエージェント的開発と乖離
Vision-language models for chest radiography do not always need the image
胸部X線の視覚言語モデルは画像を常に要しない
EComAgentBench: Benchmarking Shopping Agents on Long-Horizon Tasks with Distributed Hidden Intent
EComAgentBench、隠れた意図を含む長期課題で買い物エージェント評価
LLMs Infer Cultural Context but Fail to Apply It When Responding
LLMは文化的文脈を推測できても応答で適用できない
SuCo: Sufficiency-guided Continuous Adaptive Reasoning
SuCo、十分性に導かれた連続適応的推論
EnvRL: Learn from Environment Dynamics in Agentic Reinforcement Learning
EnvRL、環境ダイナミクスから学ぶエージェント強化学習
MambaCount、状態空間双対ブロックで開語彙物体計数
Beyond Domains: Reusing Web Skills via Transferable Interaction Patterns
領域を超えて転移可能な相互作用パターンでWebスキルを再利用
OPD-Evolver: Cultivating Holistic Agent Evolver via On-Policy Distillation
OPD-Evolver、オンポリシー蒸留で自己進化エージェントを育成
Context-Aware RL for Agentic and Multimodal LLMs
文脈選択を報酬化するRL手法ContextRLを提案
Benchmarking LLM Agents on Meta-Analysis Articles from Nature Portfolio
Nature系メタ分析論文でLLMエージェントを評価するベンチマーク
DeepRubric、評価基準を逆生成し深層リサーチエージェントのRLを効率化
HAMON: Passive Optical Sequence Mixing for Long-Horizon Forecasting
HAMON、受動的な光学回路で長期時系列予測 ─ デジタル混合層が不要
ExpRL: Exploratory RL for LLM Mid-Training
ExpRL、人手QAデータを「報酬足場」に使うLLM中間学習向けRLを提案
TokenPilot: Cache-Efficient Context Management for LLM Agents
TokenPilot、キャッシュを保つ文脈管理でLLMエージェントの推論コスト6割減
Agent trajectories as programs: fingerprinting and programming coding-agent behavior
コーディングエージェントを手続き的に同定する「指紋」手法を提案
Greed Is Learned: Visible Incentives as Reward-Hacking Triggers
報酬指標の可視化が RL 方策を「報酬チャネル依存」にし安全整合を崩すと報告
LESS Is More: Mutual-Stability Sampling for Diffusion Language Models
拡散言語モデル向け学習不要の適応サンプラ『LESS』を提案
Binary Tracking for Spatial QA and Navigation with Open Vision-Language Models
オープン VLM で動く空間質問応答・ナビ手法 Binary Tracking を提案
身体化エージェントの拒否応答を強化する合成 OOD 生成手法 Semantic Flip を提案
HawkesNest: A Multi-Axis Synthetic Benchmark for Spatiotemporal Pattern Complexity
HawkesNest: 時空間点過程モデル評価の合成ベンチマークを提案
Data-Driven Decoding of Russell's Circumplex Model of Affect
Transformer 埋め込みが感情の Russell 円環モデル幾何を再現するか検証
Beyond Models: Reflections on Engineering AI-enabled Systems in a Project-Based Course
AI搭載システムの工学教育を扱うプロジェクト型講義の実践を報告
Does Traversal Order Matter? A Systematic Study of Tree Traversal Methods in Transformer Grammars
Transformer Grammars の木探索順序を比較分析する論文
Tying the Loop -- Tied Expert Layers in Mixture-of-Experts Language Models
MoE で専門家パラメータを層間共有する手法を提案する論文
LLM 検索エージェントの推薦汚染耐性を測る枠組みを提案
GIST-CMTF: Goal-State Inference for Causal Minimal Tool Filtering in LLM Agents
ツール選択の誤目標実行を抑えるエージェント手法GIST-CMTFを提案
Scaling LLM Reasoning from Minimal Labels: A Semi-Supervised Framework with a Lightweight Verifier
少量ラベルで LLM 推論を拡張する半教師あり枠組みを提案
LabOSBench: Benchmarking Computer Use Agents for Scientific Instrument Control
科学機器を操作するエージェント評価へ、模擬ベンチLabOSBenchを提案
OpenClaw-Skill: Collective Skill Tree Search for Agentic Large Language Models
エージェント向けに再利用可能スキルを木探索で構築するCSTSを提案
Skill-to-LoRA: From Using Skills to Learning Behaviors for Token-Efficient LLM Agents
SKILL.md文書をLoRAに置換しトークン効率を高める手法S2Lを提案
MyPCBench: A Benchmark for Personally Intelligent Computer-Use Agents
個人秘書としてのPC操作エージェントを測る基準MyPCBenchを提案
Misinformation Propagation in Benign Multi-Agent Systems
多エージェント系で誤情報が伝播し性能を低下させる現象を分析
Multi-Turn Reflective Masking Elicits Reasoning in Mask Diffusion Models
マスク拡散モデルに反復的な局所修正の推論力を引き出す手法を提案
Multimodal Evaluator Preference Collapse: Cross-Modal Contagion in Self-Evolving Agents
自己進化エージェントの評価選好崩壊と跨モーダル伝播を扱う論文
FraudSMSWalker: Benchmarking Agentic Large Language Models for SMS-to-Webpage Fraud Detection
SMS経由の詐欺判定を測るベンチマークFraudSMSWalkerを提案
イスラム知識を扱う信頼性の高いLLMの研究動向を概観する論文
VeriGraph: Towards Verifiable Data-Analytic Agents
データ分析エージェントの推論を検証可能にする VeriGraph を提案
SING: Synthetic Intention Graph for Scalable Active Tool Discovery in LLM Agents
LLM エージェントのツール探索を拡張する手法 SING を提案
Uncertainty Is Not a Safety Net for Clinical VQA, but Can It Anticipate Model Failure?
臨床 VQA で不確実性推定は安全網にならないと検証
Can LLM Agents Infer World Models? Evidence from Agentic Automata Learning
LLM エージェントは世界モデルを推論できるか、オートマトン学習で検証
語義変化検出の新ベンチマーク BD-LSC データセットを公開
Can LLM Coding Agents Reason About Time Series?
LLM コーディングエージェントは時系列を推論できるか検証
GPUカーネル最適化向けスキル共進化RL「daVinci-kernel」を提案