NVIDIA × Training & Fine-tuning

NVIDIA speeds BEV Pooling on GPU

NVIDIA speeds BEV Pooling on GPU

✎ Story body

NVIDIA published GPU-accelerated BEV (Bird's Eye View) Pooling for Physical AI workloads — autonomous driving and robotics territory. The story is the fine-tuning pipeline getting quietly faster and cheaper. Hugging Face threads on speeding Transformers fine-tuning via NeMo AutoModel and experiments with Cross-Origin Storage in Transformers.js ran alongside. No flagship launch, but a steady drumbeat of tooling improvements: the daily grind of shipping models is getting easier. Watch for benchmark numbers from teams actually training on this stack.

▲ Official & Press
Official

Accelerating BEV Pooling on NVIDIA GPUs for Physical AI Applications

NVIDIA Developer Blog ・ 2026-06-24 ・ 📌

NVIDIA accelerates BEV pooling on its GPUs for physical AI applications

Press

中国が人型ロボット開発で急成長しているワケ 日本が学ぶべきポイントは? 専門家が解説

ITmedia AI+ ・ 2026-06-25

Why China is surging in humanoid robot development, and lessons for Japan

Press

「今日言うつもりはなかったが……」 孫正義氏が明かした「ロボット自動量産工場」の実態

ITmedia AI+ ・ 2026-06-25

SoftBank's Son reveals the state of 'robot auto-mass-production' plants

Official

Accelerating Transformers Fine-Tuning with NVIDIA NeMo AutoModel

Hugging Face Blog ・ 2026-06-24

Hugging Face speeds up Transformer fine-tuning with NeMo AutoModel

Press

「Transformerの最大475倍」 富士通、GPUを効率的に使うLLMアーキテクチャ「PHOTON」開発

ITmedia AI+ ・ 2026-06-24

Fujitsu develops PHOTON architecture to run LLMs on fewer GPUs

Press

陸自駐屯地で四足歩行型の警備用ロボットが見回り GMOインターネットグループが開発

ITmedia AI+ ・ 2026-06-24

GMO Internet Group develops a four-legged security robot

Press

“中国ヒューマノイド革命”はなぜ起きた、異業種や大手テックが動かす市場の今

ITmedia AI+ ・ 2026-06-23

China's humanoid robots hit ~7x shipments and 80% global share

Press

トヨタ系金融会社はなぜ「AIエージェントだけ」でも「RPAだけ」でもなく“併用”にしたのか

ITmedia AI+ ・ 2026-06-23

Toyota Finance pairs AI agents with existing RPA for customer inquiries

Official

Experimenting with the proposed Cross-Origin Storage API in Transformers.js

Hugging Face Blog ・ 2026-06-23

Hugging Face tries proposed Cross-Origin Storage API in Transformers.js

Community

Porting the Moebius 0.2B image inpainting model to run in the browser with Claude Code

Simon Willison's Weblog ・ 2026-06-22

Simon Willison ports the 0.2B Moebius inpainting model to the browser via WebGPU

Academic (arxiv etc.) 84 ▾
Academic

Language-Based Digital Twins for Elderly Cognitive Assistance

arXiv cs.AI (Artificial Intelligence) ・ 2026-06-25

Academic

Hallucination in World Models is Predictable and Preventable

arXiv cs.LG (Machine Learning) ・ 2026-06-25

Academic

A Multi-Fidelity Convolutional Autoencoder-Transfer Learning Framework for Guided-Wave-Based Damage Diagnosis Using Large Simulated and Limited Experimental Datasets

arXiv cs.LG (Machine Learning) ・ 2026-06-25

Academic

E-TTS: A New Embodied Test-Time Scaling Framework for Robotic Manipulation

arXiv cs.AI (Artificial Intelligence) ・ 2026-06-25

Academic

Paved with True Intents: Intent-Aware Training Improves LLM Safety Classification Across Training Regimes

arXiv cs.CL (Computation and Language) ・ 2026-06-25

Academic

Graph Neural Networks Applications Across Domains: All Insights You Need

arXiv cs.LG (Machine Learning) ・ 2026-06-25

Academic

HarmVideoBench: Benchmarking Harmful Video Understanding in Large Multimodal Models

arXiv cs.CL (Computation and Language) ・ 2026-06-25

Academic

Learning to Fold: prizewinning solution at LeHome Challenge 2026 (1st place online, 2nd offline)

arXiv cs.LG (Machine Learning) ・ 2026-06-25

Academic

Safe Autoregressive Image Generation with Iterative Self-Improving Codebooks

arXiv cs.AI (Artificial Intelligence) ・ 2026-06-25

Academic

Kolmogorov Arnold networks (KAN) for aerodynamic prediction: a comparison with MLPs and GNNs

arXiv cs.LG (Machine Learning) ・ 2026-06-25

Academic

Transformer-Based Classification of Bacterial Raman Spectra with LOOCV

arXiv cs.LG (Machine Learning) ・ 2026-06-25

Academic

Inherited Circuits, Learned Semantics: How Fine-Tuning Creates Evasion Vulnerabilities Invisible to Standard Evaluation

arXiv cs.AI (Artificial Intelligence) ・ 2026-06-25

Academic

Towards Explainable Adjudicative Variance: Quantifying Judicial Discretion via Gated Multi-Task Learning

arXiv cs.CL (Computation and Language) ・ 2026-06-25

Academic

Improving General Role-Playing Agents via Psychology-Grounded Reasoning and Role-Aware Policy Optimization

arXiv cs.CL (Computation and Language) ・ 2026-06-25

Academic

Just how sure are you? Improving Verbalized Uncertainty Calibration in Medical VQA

arXiv cs.LG (Machine Learning) ・ 2026-06-25

Academic

GAVEL: Grounded Caption Error Verification and Localization

arXiv cs.CL (Computation and Language) ・ 2026-06-25

Academic

SamaVaani: Auditing and Debiasing Multilingual Clinical ASR for Indian Languages

arXiv cs.CL (Computation and Language) ・ 2026-06-25

Academic

Reasoning Quality Emerges Early: Data Curation for Reasoning Models

arXiv cs.LG (Machine Learning) ・ 2026-06-25

Academic

AIGP: An LLM-Based Framework for Long-Term Value Alignment in E-Commerce Pricing

arXiv cs.LG (Machine Learning) ・ 2026-06-25

Academic

Escaping Iterative Parameter-Space Noise: Differentially Private Learning with a Hypernetwork

arXiv cs.LG (Machine Learning) ・ 2026-06-25

Academic

Learning Action Priors for Cross-embodiment Robot Manipulation

arXiv cs.AI (Artificial Intelligence) ・ 2026-06-24

Academic

How Robust is OCR-Reasoning? Evaluating OCR-Reasoning Robustness of Vision-Language Models under Visual Perturbations

arXiv cs.CL (Computation and Language) ・ 2026-06-24

Academic

Detect, Unlearn, Restore: Defending Text Summarization Models Against Data Poisoning

arXiv cs.CL (Computation and Language) ・ 2026-06-24

Academic

Why Multi-Step Tool-Use Reinforcement Learning Collapses and How Supervisory Signals Fix It

arXiv cs.CL (Computation and Language) ・ 2026-06-24

Academic

Privacy Vulnerabilities of Attention Layers in Tabular Foundation Models and Protection of High-Risk Queries

arXiv cs.AI (Artificial Intelligence) ・ 2026-06-24

Academic

The Tatoxa System for Text Detoxification in Low-Resource Languages: The Case of Tatar

arXiv cs.CL (Computation and Language) ・ 2026-06-24

Academic

FORCE: Efficient VLA Reinforcement Fine-Tuning via Value-Calibrated Warm-up and Self-Distillation

arXiv cs.AI (Artificial Intelligence) ・ 2026-06-24

Academic

Dziri Voicebot: An End-to-End Low-Resource Speech-to-Speech Conversational System for Algerian Dialect

arXiv cs.CL (Computation and Language) ・ 2026-06-24

Academic

Hierarchical Reinforcement Learning for Neural Network Compression (HiReLC): Pruning and Quantization

arXiv cs.AI (Artificial Intelligence) ・ 2026-06-24

Academic

Weave of Formal Thought

arXiv cs.AI (Artificial Intelligence) ・ 2026-06-24

Academic

Multi-Agent Goal Recognition with Team- and Goal-Conditioned Reinforcement Learning and Factorized Branch-and-Bound

arXiv cs.AI (Artificial Intelligence) ・ 2026-06-24

Academic

Tensorion: A Tensor-Aware Generalization of the Muon Optimizer

arXiv cs.LG (Machine Learning) ・ 2026-06-24

Academic

WinDOM: Self-Family Distillation for Small-Model GUI Grounding

arXiv cs.AI (Artificial Intelligence) ・ 2026-06-24

Academic

Enhancing Brain MRI Anomaly Detection and Reasoning with ROI Rethink and Synthetic Data

arXiv cs.AI (Artificial Intelligence) ・ 2026-06-24

Academic

AutoRelAnnotator: Calibrated Model Cascades for Cost-Efficient Relevance Evaluation in Sponsored Search

arXiv cs.AI (Artificial Intelligence) ・ 2026-06-24

Academic

Edges Before Embeddings: A Confidence-Aware Blur Gate for Vision-Language Pipelines

arXiv cs.AI (Artificial Intelligence) ・ 2026-06-24

Academic

ROAD-VLA: Robust Online Adaptation via Self-Distillation for Vision-Language-Action Models

arXiv cs.LG (Machine Learning) ・ 2026-06-24

Academic

Uncertainty Quantification for Computer-Use Agents: A Benchmark across Vision-Language Models and GUI Grounding Datasets

arXiv cs.AI (Artificial Intelligence) ・ 2026-06-24

Academic

Memory-Efficient Policy Libraries with Low-Rank Adaptation in Reinforcement Learning

arXiv cs.LG (Machine Learning) ・ 2026-06-24

Academic

BitNet Text Embeddings

arXiv cs.CL (Computation and Language) ・ 2026-06-24

Academic

Steering Vision-Language Models with Joint Sparse Autoencoders

arXiv cs.AI (Artificial Intelligence) ・ 2026-06-24

Academic

TL++: Accuracy and Privacy Preserving Traversal Learning for Distributed Intelligent Systems

arXiv cs.LG (Machine Learning) ・ 2026-06-24

Academic

Expresso-AI: Explainable Video-Based Deep Learning Models for Depression Diagnosis

arXiv cs.LG (Machine Learning) ・ 2026-06-24

Academic

Riazi-8B: An Urdu Large Language Model for Mathematical Reasoning

arXiv cs.CL (Computation and Language) ・ 2026-06-24

Academic

Fault of Our Stars: Behavioral Drivers of Rating-Sentiment Incongruence

arXiv cs.CL (Computation and Language) ・ 2026-06-24

Academic

Spam and Sentiment Detection in Arabic Tweets Using MARBERT Model

arXiv cs.CL (Computation and Language) ・ 2026-06-24

Academic

Optimizing Abstractive Summarization With Fine-Tuned PEGASUS

arXiv cs.CL (Computation and Language) ・ 2026-06-24

Academic

The Generalization Spectrum: A Chromatographic Approach to Evaluating Learning Algorithms

arXiv cs.CL (Computation and Language) ・ 2026-06-24

Academic

Evaluating Japanese Dialect Robustness Across Speech and Text-based Large Language Models

arXiv cs.CL (Computation and Language) ・ 2026-06-24

Academic

InSight: Self-Guided Skill Acquisition via Steerable VLAs

arXiv cs.AI (Artificial Intelligence) ・ 2026-06-23

Academic

FLUX3D: High-Fidelity 3D Gaussian Generation with Diffusion-Aligned Sparse Representation

arXiv cs.AI (Artificial Intelligence) ・ 2026-06-23

Academic

Matching Tasks to Objectives: Fine-Tuning and Prompt-Tuning Strategies for Encoder-Decoder Pre-trained Language Models

arXiv cs.AI (Artificial Intelligence) ・ 2026-06-23

Academic

L3Cube-MahaPOS: A Marathi Part-of-Speech Tagging Dataset and BERT Models

arXiv cs.CL (Computation and Language) ・ 2026-06-23

Academic

SHERLOC: Structured Diagnostic Localization for Code Repair Agents

arXiv cs.CL (Computation and Language) ・ 2026-06-23

Academic

OrbitForge: Text-to-3D Scene Generation via Reconstruction-Anchored Video Synthesis

arXiv cs.AI (Artificial Intelligence) ・ 2026-06-23

Academic

UniDrive: A Unified Vision-Language and Grounding Framework for Interpretable Risk Understanding in Autonomous Driving

arXiv cs.AI (Artificial Intelligence) ・ 2026-06-23

Academic

Can Scale Save Us From Plasticity Loss in Large Language Models?

arXiv cs.AI (Artificial Intelligence) ・ 2026-06-23

Academic

Decentralised AI Training and Inference with BlockTrain

arXiv cs.AI (Artificial Intelligence) ・ 2026-06-23

Academic

A Physics-Informed Fourier-Wavelet Transformer for Multiscale Computational Fluid Dynamics Surrogate Modeling

arXiv cs.LG (Machine Learning) ・ 2026-06-23

Academic

CineCap: Structured Reasoning with Spatio-Temporal Anchors for Cinematographic Video Captioning

arXiv cs.AI (Artificial Intelligence) ・ 2026-06-23

Academic

ScaleToT: Generalizing Structured LLM Reasoning for Billion-Scale Low-Activity User Modeling

arXiv cs.AI (Artificial Intelligence) ・ 2026-06-23

Academic

Uncertainty-Aware Longitudinal Forecasting of Alzheimer's Disease Progression Using Deep Learning

arXiv cs.AI (Artificial Intelligence) ・ 2026-06-23

Academic

Qwen-AgentWorld: Language World Models for General Agents

arXiv cs.CL (Computation and Language) ・ 2026-06-23

Academic

Reinforcement Learning for Computer-Use Agents with Autonomous Evaluation

arXiv cs.AI (Artificial Intelligence) ・ 2026-06-23

Academic

An LLM-based Two-Stage Transformer Framework for Cross-Domain Bearing Fault Diagnosis with Limited Data

arXiv cs.CL (Computation and Language) ・ 2026-06-23

Academic

MedPCFM: Improving Medical Point Cloud Completion by Integrating Point Transformers and Flow Matching

arXiv cs.LG (Machine Learning) ・ 2026-06-23

Academic

Parallel Manifold Steering: Efficient Adaptation of Large Associative Memories via Residual Energy Shaping

arXiv cs.LG (Machine Learning) ・ 2026-06-23

Academic

PHANTOM: A Large-Scale Dataset of Multimodal Adversarial Attacks for Vision-Language Models

arXiv cs.LG (Machine Learning) ・ 2026-06-23

Academic

AutoSpecNER: A Fine-Grained Named Entity Recognition Dataset for Vehicle Specification Extraction

arXiv cs.CL (Computation and Language) ・ 2026-06-23

Academic

Open-Vocabulary BEV Segmentation with 3D-Aware Geometric Constraints

arXiv cs.LG (Machine Learning) ・ 2026-06-23

Academic

SURGELLM: Rethinking Multi-Task Evaluation through Task-Aware Feature Gating with Class-Balanced Normalization

arXiv cs.CL (Computation and Language) ・ 2026-06-23

Academic

Automated Residual Plot Assessment With the R Package autovi and the Shiny Application autovi.web

arXiv cs.LG (Machine Learning) ・ 2026-06-23

Academic

Lightweight Transformer Models for On-Device Fault Detection: A Benchmark Study on Resource-Constrained Deployment

arXiv cs.LG (Machine Learning) ・ 2026-06-23

Academic

When Top-1 Fails: Calibrating LoRA Monitors for Masked Diffusion LMs

arXiv cs.LG (Machine Learning) ・ 2026-06-23

Academic

NeuroSonic: Conditional Flow Matching for EEG-to-Speech Reconstruction

arXiv cs.LG (Machine Learning) ・ 2026-06-23

Academic

Tapered Language Models

arXiv cs.LG (Machine Learning) ・ 2026-06-22

Academic

Muown Implicitly Performs Angular Step-size Decay

arXiv cs.LG (Machine Learning) ・ 2026-06-22

Academic

DiT-Reward: Generative Representations for Text-to-Image Reward Modeling

arXiv cs.LG (Machine Learning) ・ 2026-06-22

Academic

Scaling Linear Mode Connectivity and Merging to Billion Parameter Pretrained Transformers

arXiv cs.LG (Machine Learning) ・ 2026-06-22

Academic

The Topology of Ill-Posed Questions: Persistent Homology for Detection and Steering in LLMs

arXiv cs.AI (Artificial Intelligence) ・ 2026-06-22

Academic

A Generative Model for Closed-Loop Microsimulation of Signalized Intersections

arXiv cs.AI (Artificial Intelligence) ・ 2026-06-22

Academic

The Energy Consumption of Transformer Fine-Tuning: A Roofline-Inspired Scaling Model

arXiv cs.LG (Machine Learning) ・ 2026-06-22

Academic

HyperQuant: A Rate-Distortion-Optimal Quantization Pipeline for Large Language and Diffusion Models

arXiv cs.AI (Artificial Intelligence) ・ 2026-06-22

Academic

Energy-Based Transformers as Predictors of Reading Difficulty

arXiv cs.AI (Artificial Intelligence) ・ 2026-06-22

← Story Archive