Multimodal
A
Showing 31–60 of 81
-
Multimodal Cultural Heritage Architectural Style Classification for Residential Buildings in the UAE Based on CLIP Embeddings and SVM
-
MOCC-R1: Reinforcing Reasoning-Response Consistency for Multimodal Counselor Response Generation
-
MUMINS: Metadata-conditioned Uncertainty-aware Medical Image Next-state Synthesis
-
ResLRP: The Role of Residual Cancellation in Attribution Instability in Vision Transformers
-
Intrinsic Robot Rewarding: Reusing VLA Representations for Autonomous Evaluation and Policy Improvement
-
Beyond In-Distribution Metrics: A Systematic Out-of-Distribution Evaluation of Congenital Heart Disease Segmentation
-
Neuro-Symbolic Hierarchical Intention Anticipation in Human Behavior
-
Distributed JEPA: A Self-Supervised Framework for Energy Forecasting
-
PaperDoctor: Evidence-Grounded and Actionable Feedback for Scientific Papers in Progress
-
Beyond Token-Local Imitation: Reward-Compatible Temporal Credit Assignment for On-Policy Distillation
-
RiskChainBench: A Benchmark for Obfuscated Platform Message Restoration and Evidence-Grounded Web Investigation
-
「ブラウザを開く手間」を解消 作業画面に直接呼び出せるWindows版「Gemini」公開Google ships a native Windows Gemini app, summoned with Alt+SpaceGoogle released a native Gemini app for Windows 10 and 11 that users can call up directly over their work screen with an Alt+Space shortcut. It links to Google Drive and supports image and video generation, removing the step of opening a browser first.
-
LSREP: A Longitudinal State-Replay Protocol for Evaluating Conversational Memory, with ICE v2 as an Audited Local-First Architecture
-
Discovery Foundation Models: Toward Open-Ended Discovery Intelligence
-
Mind2Dialogue: Training Human-Aware Language Models by Simulating User Mental States
-
HypoEvolve: Genetic Algorithms Enable Multi-Agent LLMs to Discover Scientific Hypotheses
-
SlipSense: Multimodal Tactile Learning for Low-Latency and Generalized Slip Detection
-
Anatomical Grounding and Leakage-Aware Multimodal Contrastive Learning for Alzheimer's Disease Classification from Structural MRI
-
Learning Multimodal One-step Flow Policy via Value-weighted Optimal Transport
-
Transfer Learning for Socioeconomic Estimation in Forced-Displacement Settings
-
A Language-Guided Multimodal Foundation Model for Zero-Shot and Multi-Task Brain Signal Analysis
-
Bench2Dex: Benchmarking Visuo-Tactile Bimanual Dexterous Manipulation Across Dexterous Hands
-
Beyond Accuracy: Robustness, Cost, and Governance Trade-offs for Vision-Language Models in Templated Document Extraction
-
More Than Just Access: Generative AI as Communication Intermediary for Blind and Low-Vision Users
-
NoteVQA: Benchmarking VLMs on Real-Life Questions from Human Communities
-
Don't Send What You Don't Need: Question-Guided Token Pruning as a Privacy Defense for Vision-Language Models
-
Benchmarking Intra-Patient 3D Deformable Multimodal Image Registration
-
Circuit-MLLM: Topological Logic-Guided Latent-Space Visual Reasoning for Circuit Schematic Understanding
-
Human-Grounded Calibration for Long-Text Image-Text Congruence in Vision-Language Models
-
ModaLens: Measuring Image Sensitivity in Report-Conditioned Medical VLMs