Multimodal A
Showing 1–30 of 127
-
Differentially Private Nonparametric Modal Learning with Applications to Regression and Clustering
-
The Theoretical Foundation of Socratic Tests: Dynamic, Multimodal, Conversational Examinations
-
WCM: A World Critic Model for Vision-Language-Action Reinforcement Learning
-
FriendBench: Benchmarking Dyadic Familiarity Inference in Humans and Multimodal Large Language Models
-
TraceViT: Grounded Trace Supervision for Visual Abstract Reasoning
-
Sycophancy Undermines Epistemic Vigilance in Cooperative Vision-Language Tasks
-
AMTFV: Agentic Mathematical Tool-Flow Verification for LLM Self-Correction
-
NVIDIA Video Codec SDK 13.1: Zero-Copy Transcode, AV1 B-Frames, and Frame-Accurate SeekNVIDIA ships Video Codec SDK 13.1 with zero-copy transcode, AV1 B-framesNVIDIA released Video Codec SDK 13.1, adding zero-copy transcoding, AV1 B-frame support, and frame-accurate seeking. The update targets accelerating demand for high-quality video across industries, from immersive streaming to media pipelines.
-
Adaptive FastOPD: Progress-Aware Rollout Horizon Expansion for Efficient On-Policy Distillation
-
QR-Structured Thermal Triggers for Targeted Semantic Attacks on Infrared Vision-Language Models
-
Beyond Retrieval: Analytic Memory for Multimodal Agents
-
Stable Autoregressive Speech Generation with Low-Frame-Rate High-Dimensional Continuous Tokens
-
SeekBrain: An Autonomous Multi-Agent System for Accelerating Neuroscience Discovery
-
MAGA: Multi-Platform Self-Fusion of GUI Agents via Structured Action Distillation
-
Veolia to operate 350MW gas-powered microgrid for Ohio data center campusVeolia to run 350MW gas-powered microgrid for Ohio data centerVeolia will operate a 350MW microgrid for an Ohio data center campus, according to DatacenterDynamics. The system will be anchored by natural gas generation and supplemented with a battery energy storage (BESS) unit to provide reliable power for the large facility.
-
Data Turnstile: A Scalable Open Framework for Function-Calling Data Generation
-
When Model Priors Conflict with Visual Evidence: Mitigating Commonsense-Driven Hallucinations by Selective Prior Calibration
-
GALA: Generative Aligned Learning for Adaptive Multimodal Representation in the Taobao Shangou Recommender System
-
Knowing When to Quit: Diagnosing and Training LLMs to Abort Futile Reasoning
-
Hy-MultiTurn: A Six-Dimensional Benchmark for Deep Multi-Turn Dialogue Understanding
-
MoRAE: Flow-Friendly Self-Supervised Latents for Text-to-Motion Generation
-
Faster but Different: Diagnosing and Controlling Content Drift in Accelerated Multimodal Diffusion Language Models
-
Adjudicated Captioning: Multi-Agent Alignment Scoring and Consensus-Distilled Beam Arbitration for Strict Zero-Shot Image Captioning
-
BLADE: Boundary-Expanded and Layer-Adaptive Dynamic Exit for Efficient LLM Reasoning
-
TORUS: A Test of Rendering-Understanding Self-Coherence for Unified Audio Models
-
ReToken: One Token to Improve Vision-Language Models for Visual Retrieval
-
OSReward: Instituting Standardized Evaluation for Cross-Platform Computer-Use Reward Models
-
Change2Task: From Repository Changes to Executable Coding Agent Tasks and Environments
-
VAD: Attributing Visual Evidence for Target Reconstruction in Multimodal On-Policy Distillation
-
MixFrag: Fragility-Guided Mixed-Precision Post-Training Quantization for Vision Transformers