マルチモーダル A
127 件中 1〜30 件目を表示
-
Differentially Private Nonparametric Modal Learning with Applications to Regression and Clustering
-
The Theoretical Foundation of Socratic Tests: Dynamic, Multimodal, Conversational Examinations
-
WCM: A World Critic Model for Vision-Language-Action Reinforcement Learning
-
FriendBench: Benchmarking Dyadic Familiarity Inference in Humans and Multimodal Large Language Models
-
TraceViT: Grounded Trace Supervision for Visual Abstract Reasoning
-
Sycophancy Undermines Epistemic Vigilance in Cooperative Vision-Language Tasks
-
AMTFV: Agentic Mathematical Tool-Flow Verification for LLM Self-Correction
-
NVIDIA Video Codec SDK 13.1: Zero-Copy Transcode, AV1 B-Frames, and Frame-Accurate SeekNVIDIA、Video Codec SDK 13.1公開、ゼロコピー変換とAV1対応NVIDIAはVideo Codec SDK 13.1をリリースした。ゼロコピー・トランスコード、AV1のBフレーム対応、フレーム単位の正確なシークなどを追加し、高品質動画処理の需要拡大に対応する。
-
Adaptive FastOPD: Progress-Aware Rollout Horizon Expansion for Efficient On-Policy Distillation
-
QR-Structured Thermal Triggers for Targeted Semantic Attacks on Infrared Vision-Language Models
-
Beyond Retrieval: Analytic Memory for Multimodal Agents
-
Stable Autoregressive Speech Generation with Low-Frame-Rate High-Dimensional Continuous Tokens
-
SeekBrain: An Autonomous Multi-Agent System for Accelerating Neuroscience Discovery
-
MAGA: Multi-Platform Self-Fusion of GUI Agents via Structured Action Distillation
-
Veolia to operate 350MW gas-powered microgrid for Ohio data center campusVeolia、オハイオ州DC向け350MWガス火力マイクログリッドを運営へデータセンターダイナミクスによると、Veoliaは米オハイオ州のデータセンターキャンパス向けに350MW規模のマイクログリッドを運営する。天然ガス発電を主軸に、蓄電池システム(BESS)で補完する構成で、大規模DCの安定電源を確保する。
-
Data Turnstile: A Scalable Open Framework for Function-Calling Data Generation
-
When Model Priors Conflict with Visual Evidence: Mitigating Commonsense-Driven Hallucinations by Selective Prior Calibration
-
GALA: Generative Aligned Learning for Adaptive Multimodal Representation in the Taobao Shangou Recommender System
-
Knowing When to Quit: Diagnosing and Training LLMs to Abort Futile Reasoning
-
Hy-MultiTurn: A Six-Dimensional Benchmark for Deep Multi-Turn Dialogue Understanding
-
MoRAE: Flow-Friendly Self-Supervised Latents for Text-to-Motion Generation
-
Faster but Different: Diagnosing and Controlling Content Drift in Accelerated Multimodal Diffusion Language Models
-
Adjudicated Captioning: Multi-Agent Alignment Scoring and Consensus-Distilled Beam Arbitration for Strict Zero-Shot Image Captioning
-
BLADE: Boundary-Expanded and Layer-Adaptive Dynamic Exit for Efficient LLM Reasoning
-
TORUS: A Test of Rendering-Understanding Self-Coherence for Unified Audio Models
-
ReToken: One Token to Improve Vision-Language Models for Visual Retrieval
-
OSReward: Instituting Standardized Evaluation for Cross-Platform Computer-Use Reward Models
-
Change2Task: From Repository Changes to Executable Coding Agent Tasks and Environments
-
VAD: Attributing Visual Evidence for Target Reconstruction in Multimodal On-Policy Distillation
-
MixFrag: Fragility-Guided Mixed-Precision Post-Training Quantization for Vision Transformers