新モデル・リリース A
315 件中 271〜300 件目を表示
-
Stemma: Induced Decision Regions Reveal LLM Provenance
-
Runtime Uncertainty Monitoring for LLM-Based Multi-Agent Systems Using Bayesian Networks
-
A2TTA: Anchored-and-Agile Test-Time Adaptation for Evolving Traffic Sensor Networks
-
OmniQEC: discovering practical quantum error-correcting codes by an AI scientist
-
DRIFT: Direct-Recursive Intervention-Conditioned Forecasting of ICU Physiological Trajectories
-
China to launch new cable laying vessel next month, Global Marine Group commissions new vessel中国とGlobal Marine、新型海底ケーブル敷設船をそれぞれ投入へ中国が来月、新型の海底ケーブル敷設船を進水させる予定と報じられた。あわせてGlobal Marine Groupも新造船を発注しており、両船はそれぞれ2026年と2029年に就航する見込み。海底ケーブル敷設能力の増強が進む。
-
Lowering the implementation barrier of neutral-atom quantum computing with agentic workflows
-
Johnson Controls releases absorption chiller reference designJohnson Controls、排熱を冷却に使う吸収式チラー参照設計を公開Johnson Controlsが、吸収式チラーのリファレンス設計を公開した。データセンターが排熱(廃熱)を冷却に活用する方法を示すもので、エネルギー効率の向上と冷却コスト削減を狙う。増大するデータセンターの熱管理課題への一つの提案となる。
-
Speculate While You Reason: Teaching Agents to Predict Their Next Tool Call via Joint Agent-Speculator RL
-
WorkSurface-Bench: Benchmarking Enterprise Agents on Multi-Surface Knowledge Routing
-
From Deterministic to Generative Deep Learning for Urban Air Quality Reconstruction from Sparse Observations
-
Rashomon Alignment
-
Contextual Deconvolution for Variance-Stable Demand Sensing: Kernel-Modulated Operators in Promotional Retail
-
Localized Adaptation Reveals Distinct Learning Signatures in Transformers
-
AIriskEval-edu Demo: Auditing of Pedagogical Risks in Educational Explanations
-
Beyond Self-Knowledge: Propagating Uncertainty Across Reasoning and Retrieval in LLMs
-
Forensic Reproducibility Audit of a Radiology Vision-Language Model Benchmark: From Intended Protocol to Released Artifact
-
Multi-Scale Structural Features for Continual, Comprehensible Visual Recognition in a Developmental Learning Framework
-
AMPBench-MT: A Homology-Controlled Benchmark for Antimicrobial Peptide Potency, Spectrum, and Safety Prediction
-
Phase Structure in Rotary Attention: A Spectral Framework for Semantic Continuity and Execution-Boundary Governance
-
「痺れるほどにミスを繰り返す」Gemini 3.6 Flashは変わった? 公開から1週間、当初のおバカ回答を今検証するGemini 3.6 Flash、公開1週間で再検証 当初の誤答は改善したかITmediaが、Googleの「Gemini 3.6 Flash」を公開から約1週間の時点で再検証した記事。同モデルは公開直後、X上で数値比較の誤答や架空の魚に関する回答など精度の低さが話題となっていた。本記事では当初報告されたそれらの「おバカ回答」を改めて試し、1週間を経て挙動が変化したかを確認している。
-
Memory for Large Language Models
-
CLBench-V: Evaluating Multimodal Context Learning from Grounding to Knowledge Acquisition
-
Where Steering Signals Come From: Activation Source Selection in Activation Steering
-
VisualPatchWorld: Code World Models as Latent Structured Representations for Planning
-
A Cross-lingual Comparison of Human and Classification Model Entrainment Behavior in Code-switched Speech Settings
-
MyoCardBench: A Real-World Data Benchmark for Evaluating Large Language Models in Clinically Authentic Cardiovascular Care Scenarios
-
moonshotai/Kimi-K3Moonshot、2.8兆パラメータのKimi K3の重みをHugging Faceで公開Moonshot AIが、2.8兆パラメータの大規模言語モデル『Kimi K3』の重みをHugging Faceで公開した。ファイルサイズは1.56TBに及ぶ。同社は2025年7月のKimi K2で独自に改変したMITライセンスを導入済みで、月間アクティブユーザー1億人超または月間売上2000万ドル超の商用製品・サービスで利用する場合はUI上に『Kimi K2』を目立つ形で表示するよう求める条項を含んでいた。本記事はSimon Willisonのリンクブログによる紹介で、ライセンス条項の詳細以降は原文が途中で切れており確認不可。
-
An opinionated guide to which AI to use to do stuffSimon Willison、Ethan Mollickの「用途別・どのAIを使うべきか」ガイド刷新を紹介Simon Willisonが、Ethan Mollickの「用途別にどのAIを使うべきか」ガイドの1年間の変遷を紹介。かつてはChatGPT・Claude・Geminiのチャット中心だったが、現在はAIが長時間の人間の作業を代行するエージェント型システムが主題になったとする。Geminiはリストから外れ、ChatGPTのWork/Codex、ClaudeのCowork/Codeといったモードが解説される。※原文の抜粋は末尾が途中で切れており、以降の詳細は本文未取得のため確認不可。