BBVA が OpenAI を銀行業務の中核に据える方針を示した。発生元は5件すべて OpenAI 公式という一社中心の構成で、金融機関側の大型導入が発表として語られる――研究ではなく事業導入が起点の動きだ。行内の業務プロセスや顧客対応に生成 AI を広く組み込み、実験段階から中核システムへ格上げする点が主眼で、本流はモデルの性能そのものより、規制の厳しい銀行が AI を「基幹」と位置づけた導入姿勢の踏み込みにある。金融という保守的な領域での本格採用の事例として注目される。ただし現段階は方針表明で、実装範囲やリスク管理、成果は今後の確認点として残る。
BBVA、OpenAIで銀行業務の中核にAI据える
BBVA、OpenAIで銀行業務の中核にAI据える
OpenAI WebRTC Audio Session, now with document context
Simon Willison、OpenAI WebRTC音声ツールに文書コンテキスト機能を追加
Simon Willison、Andrew Singletonの発言を引用紹介
スマホからWindowsのCodexアプリを操作できるの? 外出中でもAIコーディングを止めない方法
WindowsのCodexアプリ、スマホから操作可能に 外出先でも開発継続
Timing Trick Cuts Energy Used in LLM Training by Up to 14 Percent
タイミングの工夫でLLM学習のエネルギーを最大14%削減
OpenAI、米国でのIPOを内密に申請と発表 時期は未定
学術(arxiv ほか) 42本 ▾
本番LLMエージェント runtime の「静かな障害」を縦断分類
異種鉄道網の遅延対応・動的経路最適化の時間計画フレームワーク
From Shield to Target: Denial-of-Service Attacks on LLM-Based Agent Guardrails
LLMエージェントのガードレールを狙うサービス妨害攻撃を提示
Every Eval Ever: A Unifying Schema and Community Repository for AI Evaluation Results
AI評価結果を統一するスキーマと共有レポジトリ「Every Eval Ever」
Fodor and Pylyshyn's Systematicity Challenge Still Stands
ニューラルネットでもなお残る体系性の課題を再評価
tap: A File-Based Protocol for Heterogeneous LLM Agent Collaboration
異種LLMエージェント協調のファイルベースプロトコル「tap」
Retrospective Progress-Aware Self-Refinement for LLM Agent Training
進捗を自覚する自己改善でLLMエージェント訓練を強化
Does the Judge Prefer English? Evaluating Language-Switching Invariance in LLM-as-a-Judge
LLM審判は英語を好むか、言語切替の不変性を評価
CacheRL:Multi-Turn Tool-Calling Agents via Cached Rollouts and Hybrid Reward
CacheRL、キャッシュ活用で小型ツール呼出エージェントを訓練
Spatio-Temporal Audio Language Modeling for Dynamic Sound Sources
動的な音源の時空間を扱う音声言語モデル
HyperTool: Beyond Step-Wise Tool Calls for Tool-Augmented Agents
HyperTool、ツール呼び出しをコードに畳み込みMCP精度を15.7%から35.3%へ
再帰エージェントハーネスRAH、長文脈推論でCodex基準71.75%を81.36%に
AgentBeats: Agentifying Agent Assessment for Openness, Standardization, and Reproducibility
AgentBeats、judge agentで評価を標準化するAAAを提唱
EpiBench: Verifiable Evaluation of AI Agents on Epigenomics Analysis
EpiBench、AI agentのエピゲノム解析を検証、最高45%
A Three-Layer Framework for AI in Scientific Discovery
科学発見のAIを3層で整理、中核は『モデル形成』と主張
AgentRivet: an automated system for producing Rivet routines from journal publications
AgentRivet、論文から欠落Rivetルーチンを自動生成するLLM系
CRAFTIIF、4種の異常を解釈可能に検出する教師なし手法
Optimizing Appliance Scheduling for Solar Energy Management Using Metaheuristic Algorithms
家電の起動時刻を最適化し太陽光自家消費を最大化する手法
Layer-Resolved Optimal Transport for Hallucination Detection in NMT and Abstractive Summarization
最適輸送による幻覚検出を全デコーダ層で解析、要約への転移も検証
SICI: A Semantic-Pragmatic Complexity Index Reveals Regime Shifts in LLM Stance Detection
意味・語用論的複雑性指標SICI、LLM立場検出のレジーム変化を解明
HyPE、ハイパーグラフでペルソナ対話の高次関係をモデル化
TAHOE: Text-to-SQL with Automated Hint Optimization from Experience
Tahoe、経験からヒントを学びText-to-SQLを本番最適化
Atlas H&E-TME: Scalable AI-Based Tissue Profiling at Expert Pathologist-Level Accuracy
Atlas H&E-TME、H&E画像を専門家級精度で組織プロファイリング
Claw-SWE-Bench: A Benchmark for Evaluating OpenClaw-style Agent Harnesses on Coding Tasks
Claw-SWE-Bench、OpenClaw型エージェントのコード能力を多言語評価
Adjoint Method versus Physics-Informed Neural Networks in PDE-Constrained Inverse Problems
PDE 制約逆問題で随伴法と PINN を同条件で公平比較
SpikeDecoder: Realizing the GPT Architecture with Spiking Neural Networks
SpikeDecoder、スパイキング神経網でGPT型デコーダを実現
Finding Multiple Interpretations in Datasets
同精度でも特性の大きく異なるモデル群を発見する手法を提案
Market Design for AI: Beyond the Copyright Binary
AI学習データの市場設計、著作権の二者択一を超える提案
Soft-Prompt Tuning for Fair and Efficient LLM Benchmark Evaluation
ソフトプロンプト調整で公平かつ効率的なベンチ評価を実現
Debiasing Without Protected Attributes: Latent Concept Erasure from Textual Profiles
H-SAL、保護属性なしで自己記述からバイアスを除去
ABC-Bench: An Agentic Bio-Capabilities Benchmark for Biosecurity
ABC-Bench、LLMエージェントのバイオセキュリティ関連能力を評価
Generative Archetype-Grounded Item Representations for Sequential Recommendation
GenAIR、対象顧客像で接地した生成的アイテム表現で推薦改善
Frontier Coding Agents Use Metaprogramming to Adapt to Unfamiliar Programming Languages
最先端コーディングエージェント、難解言語へメタプログラミングで適応
It Takes One to Bias Them All: Breaking Bad with One-Shot GRPO
単一の偏った例によるGRPOがLLMのガードレールを破る
Ethical and Technical Limits of Deepfake Speech Datasets
ディープフェイク音声39データセットを監査、公平性評価は困難
Human-AI Teaming Through the Lens of Calibration
校正の観点から人間AI協働を分析、結合は校正を保たず
Infini Memory: Maintainable Topic Documents for Long-Term LLM Agent Memory
Infini Memory、トピック文書でエージェントの長期記憶を保守
Speaker Group Encoding in Self-supervised Speech Recognition Models
自己教師あり音声モデルの話者グループ情報の符号化を解析
Causal Ensemble Agent: Hierarchical Causal Discovery with LLM-guided Expert Reweighting
Causal Ensemble Agent、LLMが因果探索専門家を動的再重み付け