マルチモーダル A
124 件中 61〜90 件目を表示
-
DenseOn with the LateOn: Fully Open Dense and Late-Interaction Models for Multilingual, Long-Context, and Code Search
-
Anatomy Contextualized Adaption of CT Foundation Models
-
DLAM: Distributional Latent Actions with Temporal Constraints
-
Equilibrium Training of Energy-Based Models with Parallel Trajectory Tempering
-
Visual Credit Audit for Multimodal Spatial Reasoning
-
SciFigAlign: Scoring Scientific Figures by Fine-tuned Alignment of Visuals with Manuscript Evidence
-
What Can Latent World Models Know? Physical Parameter Identifiability in Multimodal Predictive Representations
-
Foundation Models for Face Presentation Attack Detection: A Unified Linear-Probing Benchmark
-
Progressive Multimodal Alignment for Continual Instruction Tuning
-
Dual-Path LLM Reasoning for Multimodal Few-Shot Knowledge Graph Completion
-
Hearsay: Vision-Language Medical Diagnoses Without an Image
-
Amortized Moment Matching for Visual Generation
-
See2Think: Do Multimodal Models Really Use Intermediate Visual States?
-
Multimodal fusion of visual and morphometric features for avian bone classification
-
Zero-Shot Face-to-Speech Synthesis via Latent Space Adaptation of a Style-Diffusion TTS Model
-
Dual Inversion for Text-to-Image Diffusion Models: From Both Prompt and Noise Perspectives
-
Where Detectors Fail: Closing the Tail-Domain Gap with Expert-Guided Mutual Distillation
-
Learning Dynamic User Personas from Implicit Interaction Streams via Iterative Refinement
-
Diagnosing Fine-Grained Inconsistency Classification in Financial Disclosure Text
-
Symphony of Bias: Exploring Gender Associations with Musical Instruments in Multimodal LLMs
-
Pass the Baton: Trajectory-Relayed On-Policy Distillation
-
$π\mathbf{R}^2$: Reactive Real-time Flow Policies
-
Re-thinking Mammography Transfer Learning: The Dataset-Informed Transfer Learning (DITL) Framework for Breast Cancer Screening and Lesion Diagnosis
-
VetClaw: An Edge-Cloud Multimodal Agentic System for Veterinary Disease Screening
-
Reinformed Dreamer: An Asymmetric World Model Efficiently Trained through Latent Guidance
-
CHARM: A Multimodal Graph Foundation Model with Hierarchical Context Modeling for Zero-Shot Transfer
-
MDTransformer: A Hardware-Software Co-Design of Mode-Division Photonic Transformer Accelerator with Inverse-Designed Coherent Crossbar
-
Parallel Decoding Distillation for Fast Image and Video Generation
-
Untangling Co-Drift: Proactive Multi-Intent Failure Prediction and Root-Cause Disambiguation for Self-Driving Networks
-
Knowledge-Guided Multimodal Reasoning over Interacting Streams for Video-Level Ambivalence and Hesitancy Recognition