マルチモーダル
A
81 件中 31〜60 件目を表示
-
Multimodal Cultural Heritage Architectural Style Classification for Residential Buildings in the UAE Based on CLIP Embeddings and SVM
-
MOCC-R1: Reinforcing Reasoning-Response Consistency for Multimodal Counselor Response Generation
-
MUMINS: Metadata-conditioned Uncertainty-aware Medical Image Next-state Synthesis
-
ResLRP: The Role of Residual Cancellation in Attribution Instability in Vision Transformers
-
Intrinsic Robot Rewarding: Reusing VLA Representations for Autonomous Evaluation and Policy Improvement
-
Beyond In-Distribution Metrics: A Systematic Out-of-Distribution Evaluation of Congenital Heart Disease Segmentation
-
Neuro-Symbolic Hierarchical Intention Anticipation in Human Behavior
-
Distributed JEPA: A Self-Supervised Framework for Energy Forecasting
-
PaperDoctor: Evidence-Grounded and Actionable Feedback for Scientific Papers in Progress
-
Beyond Token-Local Imitation: Reward-Compatible Temporal Credit Assignment for On-Policy Distillation
-
RiskChainBench: A Benchmark for Obfuscated Platform Message Restoration and Evidence-Grounded Web Investigation
-
「ブラウザを開く手間」を解消 作業画面に直接呼び出せるWindows版「Gemini」公開Google、Windows版Geminiを公開、Alt+Spaceで即呼び出しGoogleがAIアシスタント「Gemini」をWindows 10/11のデスクトップから直接呼び出せるネイティブアプリの提供を開始した。[Alt]+[Space]のショートカットで作業画面のまま起動でき、Google Driveとの情報連携や画像・動画生成にも対応する。ブラウザを開く手間を省く狙い。
-
LSREP: A Longitudinal State-Replay Protocol for Evaluating Conversational Memory, with ICE v2 as an Audited Local-First Architecture
-
Discovery Foundation Models: Toward Open-Ended Discovery Intelligence
-
Mind2Dialogue: Training Human-Aware Language Models by Simulating User Mental States
-
HypoEvolve: Genetic Algorithms Enable Multi-Agent LLMs to Discover Scientific Hypotheses
-
SlipSense: Multimodal Tactile Learning for Low-Latency and Generalized Slip Detection
-
Anatomical Grounding and Leakage-Aware Multimodal Contrastive Learning for Alzheimer's Disease Classification from Structural MRI
-
Learning Multimodal One-step Flow Policy via Value-weighted Optimal Transport
-
Transfer Learning for Socioeconomic Estimation in Forced-Displacement Settings
-
A Language-Guided Multimodal Foundation Model for Zero-Shot and Multi-Task Brain Signal Analysis
-
Bench2Dex: Benchmarking Visuo-Tactile Bimanual Dexterous Manipulation Across Dexterous Hands
-
Beyond Accuracy: Robustness, Cost, and Governance Trade-offs for Vision-Language Models in Templated Document Extraction
-
More Than Just Access: Generative AI as Communication Intermediary for Blind and Low-Vision Users
-
NoteVQA: Benchmarking VLMs on Real-Life Questions from Human Communities
-
Don't Send What You Don't Need: Question-Guided Token Pruning as a Privacy Defense for Vision-Language Models
-
Benchmarking Intra-Patient 3D Deformable Multimodal Image Registration
-
Circuit-MLLM: Topological Logic-Guided Latent-Space Visual Reasoning for Circuit Schematic Understanding
-
Human-Grounded Calibration for Long-Text Image-Text Congruence in Vision-Language Models
-
ModaLens: Measuring Image Sensitivity in Report-Conditioned Medical VLMs