Hugging Face が Strands エージェントと LeRobot を橋渡しし、Hub のモデルからロボット実機を動かす連携を公開した。発生元は HF 公式が起点で、itmedia など専門報道が追う構成――学術やコミュニティより「使える形にまとまった」ことを伝える報道が厚く、研究段階から実装・配布段階へ寄った動きと読める。主眼はモデル単体ではなく、既存のエージェント基盤とロボットハードウェアをどうつなぐかにある。オープンソースの部品が組み合わさって身体性へ向かう流れだが、実運用での安定性や対応ハードの広がりは、公開直後の段階では未知数だ。
HF、ロボ連携Strands+LeRobotエージェント公開
HF、ロボ連携Strands+LeRobotエージェント公開
From the Hugging Face Hub to robot hardware with Strands Agents and LeRobot
Strands AgentsとLeRobot、Hugging Faceのモデルをロボット実機へ
工数「76%」削減 味の素グループが「経理AIエージェント」導入で先陣を切れたワケ
味の素グループ、経理AIエージェント導入で承認業務を自律化し工数76%削減
「待ちの営業」はもう限界 ホンダがAIエージェントで挑む、商機を逃さない「濃い商談」の創出
ホンダ、新車販売にAIエージェント導入で“濃い商談”を支援し成約創出
話題の「Claude Mythos」登場で変わるセキュリティ AIエージェント時代の防衛策
Claude Mythos登場でAI攻撃が時間単位に、エージェント時代の新防衛策
Announcing Stack Overflow for Agents
「Stack Overflow for Agents」発表
かんぽ生命、AIで営業支援 “郵便局での一言”拾って保険提案へ 寸劇で分かる活用例
かんぽ生命、AIエージェントで営業支援を本格化
「ポケカ対戦AIエージェント」開発コンテスト開始 「不完全情報ゲーム」をどう制するか
ポケモンカード対戦AIエージェントの開発コンテスト開始、不完全情報ゲームに挑む
Agentic Resource Discovery: Let agents search
Hugging Face、エージェントが自ら資源を探索する手法を提案
学術(arxiv ほか) 42本 ▾
LedgerAgent: Structured State for Policy-Adherent Tool-Calling Agents
方針順守のツール呼び出しエージェントに構造化状態を与えるLedgerAgent
Sovereign Execution Brokers: Enforcing Certificate-Bound Authority in Agentic Control Planes
エージェント制御基盤で証明書束縛の権限を強制するSovereign Execution Brokers
Probe-and-Refine Tuning of Repository Guidance for Coding Agents
コーディングエージェント向けにリポジトリ指示文を調整する手法
Efficient and Sound Probabilistic Verification for AI Agents
AIエージェント向けの効率的で健全な確率的検証手法
Contagion Networks: Evaluator Bias Propagation in Multi-Agent LLM Systems
マルチエージェントLLMで評価者バイアスが伝播する現象を分析
Beyond Global Replanning: Hierarchical Recovery for Cross-Device Agent Systems
複数端末にまたがるエージェントの階層的な障害回復手法を提案
Optimal Order of Multi-Agent and General Many-Body Systems
フィードバックを持つマルチエージェント・多体系の最適次数の枠組み
UltraQuant: 4-bit KV Caching for Context-Heavy Agents
文脈の重いエージェント向け4ビットKVキャッシュUltraQuant
Analyzing Defensive Misdirection Against Model-Guided Automated Attacks on Agentic AI Systems
エージェントAIへのモデル誘導自動攻撃に対する防御的かく乱の分析
安全重要系を監督するLLMエージェントの多ターン・レッドチーミング評価
CRAX: Fast Safe Reinforcement Learning Benchmarking
安全な強化学習を高速にベンチマークするCRAX
AutoPass: Evidence-Guided LLM Agents for Compiler Performance Tuning
コンパイラ性能調整を担う証拠誘導LLMエージェントAutoPass
Automating SKILL.md Generation for Computer-Using Agents via Interaction Trajectory Mining
相互作用軌跡採掘でコンピュータ操作エージェントのSKILL.md生成を自動化
A Model-Driven Approach for Developing Families of Reinforcement Learning Environments
強化学習環境のファミリーを開発するモデル駆動手法を提案
開かれた文献環境でのエージェント論文探索ベンチScholarQuest
Augmenting Game AI with Deep Reinforcement Learning
深層強化学習でゲームAIを強化する研究
FlowMaps: Modeling Long-Term Multimodal Object Dynamics with Flow Matching
フローマッチングで長期のマルチモーダル物体動態を予測するFlowMaps
When Lower Privileges Suffice: Investigating Over-Privileged Tool Selection in LLM Agents
LLMエージェントによる過剰権限のツール選択を調査
長期運用エージェント向けに強化学習でLLMを訓練するCoD
Multi-Agent Transactive Memory
異種エージェント間で知識共有する多エージェント交換記憶
AtomMem: Building Simple and Effective Memory System for LLM Agents via Atomic Facts
原子的事実でLLMエージェントの記憶システムを構築するAtomMem
JAMER: Project-Level Code Framework Dataset and Benchmark on Professional Game Engines
プロ向けゲームエンジンのプロジェクト級コードデータセットJAMER
AgentFinVQA: A Deployable Multi-Agent Pipeline for Auditable Financial Chart QA
監査可能な金融チャートQA向け多エージェントAgentFinVQA
自律コーディングエージェントで企業データを解釈・問い合わせ
Enhancing Decision-Making with Large Language Models through Multi-Agent Fictitious Play
マルチエージェントの架空プレイで LLM の意思決定を強化
Optimal scenario design for climate emulation
気候エミュレーションの精度を高める最適シナリオ設計を提案
VLA モデルは常識を保持しているか、知識保持度を測る研究
TxBench-PP: Analyzing AI Agent Performance on Small-Molecule Preclinical Pharmacology
TxBench-PP、小分子前臨床薬理での AI エージェント性能を評価
遅延・誤作動 AEB 事象を学習注釈、極端な不均衡に対応する実用系
A Technical Taxonomy of LLM Agent Communication Protocols
LLM エージェントの通信プロトコルを技術的に分類・整理
Towards an Agent-First Web: Redesigning the Web for AI Agents
エージェント優先の Web へ、AI 向けに Web を再設計する提案
RODS: Reward-Driven Online Data Synthesis for Multi-Turn Tool-Use Agents
RODS、報酬駆動のオンラインデータ合成で多ターンツール利用を強化
TRAP: Benchmark for Task-completion and Resistance to Active Privacy-extraction
TRAP、課題遂行とプライバシー抽出耐性を測るエージェント評価
CAPRA: Scaling Feedback on Software Architecture Deliverables with a Multi-Agent LLM System
ソフト設計成果物の添削を自動化するマルチエージェントLLM「CAPRA」
RTSGameBench: An RTS Benchmark for Strategic Reasoning by Vision-Language Models
視覚言語モデルの戦略的推論を測るRTSベンチマーク
Decoupling Search from Reasoning: A Vendor-Agnostic Grounding Architecture for LLM Agents
検索と推論を分離するベンダー非依存のLLMエージェント基盤
GateMem: Benchmarking Memory Governance in Multi-Principal Shared-Memory Agents
多主体共有メモリのガバナンスを測る「GateMem」
LegalWorld: A Life-Cycle Interactive Environment for Legal Agents
法務エージェント向けライフサイクル型環境「LegalWorld」