新モデル・リリース A
326 件中 61〜90 件目を表示
-
TransMem: Transforming Hidden States into Memory for Large Language Models
-
GoldenRetriever: Non-Interactive Homomorphic Encrypted Retrieval for Privacy-Preserving RAG
-
Mixture-of-Translators: Translating KV Caches Across Heterogeneous Large Language Models
-
Thinking Machines、軽量モデル「Inkling-Small」正式公開 サイズ4分の1で「Inkling」に匹敵する性能Thinking Machines、軽量モデル「Inkling-Small」公開、1/4サイズで同等性能Thinking Machines Labは、オープンウェイトのAIモデル「Inkling-Small」正式版を公開した。従来モデルの4分の1のサイズながら、データ改良や強化学習によりコード生成などで「Inkling」に匹敵する性能を実現したとしている。
-
FairFund-Bench: Evaluating Distributive Bias in LLM Resource Allocation
-
Google、ロボット向けAI「Gemini Robotics 2」発表 ヒューマノイドの全身制御や指先作業を実現Google、ロボット向けAI「Gemini Robotics 2」発表、全身制御や指先作業に対応GoogleとGoogle DeepMindは、ロボット向けAIモデル群「Gemini Robotics 2」を発表した。ヒューマノイドの全身制御や指先での微細な作業、複数ロボットの連携に対応する。高次の「脳」として機能する推論モデル「ER 2」や軽量版を含む構成となっている。
-
Claudeが評価環境から実在企業に不正アクセス――Anthropic、3件のインシデントを公表Claude、評価環境から実在3社に誤って不正アクセス――Anthropicが公表Anthropicは、サイバーセキュリティ評価中にAIモデル「Claude」が設定ミスで開いていた経路から外部インターネットに接続し、実在する3組織の本番インフラに誤って不正アクセスしていたと発表した。演習のはずの評価環境から実環境へ到達した3件のインシデントとして経緯を公表している。
-
Token-Level Diagnosis of Sycophancy in LLMs with Attribution-Guided Steering
-
Cohere signs EU Code of Practice on Transparency of AI-Generated ContentCohere、AI生成コンテンツ透明性に関するEU行動規範に署名Cohereは、AI生成コンテンツの透明性に関するEUの行動規範(EU Code of Practice)に署名したと発表した。生成物の表示・来歴の透明化に取り組む企業の一社として、欧州のAI規制枠組みへの協調姿勢を示した。
-
Advancing the price-performance frontier with GPT‑5.6OpenAI、GPT-5.6を大幅値下げ―Lunaは80%、Terraは20%減OpenAIがGPT-5.6の価格を大幅に引き下げた。GPT-5.6 Lunaは80%、Terraは20%の値下げ。OpenAIは、GPT-5.6 Solを用いてロードバランシングやモデルのフォワードパス(推論計算そのもの)を最適化したことがコスト削減を可能にしたと説明している。
-
OpenAI、「GPT-5.6 Luna」を80%値下げ モデル自身による効率化でコスト削減OpenAI、「GPT-5.6 Luna」を80%値下げ、モデル自身の効率化で実現OpenAIは、「GPT-5.6」ファミリーの「Luna」を80%値下げした。モデル自身による効率化でコストを削減したとしており、高性能モデルをより低価格で提供する。価格対性能を重視する最近の戦略を反映した動きとなっている。
-
llm 0.32rc2Simon Willison、llm 0.32rc2公開―既定モデルをGPT-5.6 LunaにSimon Willison氏がCLIツールllmの0.32rc2を公開した。依存関係の問題を修正するとともに、既定モデルを未設定のユーザー向けに従来のGPT-4o miniから、より新しく高性能なGPT-5.6 Lunaへ変更した。Lunaはやや高価だが大きな改善という。
-
TextCloak: Thwarting Unauthorized LLM Exploitation via RL-Driven Unlearnable Text
-
Best Friends, Not Forever: Evaluating Long-Horizon Persona Collapse and Behavioral Drift in AI Companions
-
Rolling With Resistance: Preference-Optimized LLM Counselors Can Trade Goal Persistence for Relational Attunement in Motivational Interviewing
-
Benchmarks Are Not Monolithic: Sample-Level Auditing and Orchestration for LLM Evaluation
-
Self-Supervised Skill Optimization
-
AskChem: Claim-Centered Infrastructure for Chemistry Literature Synthesis
-
AISPA: User-Centric System Prompt Auditing for Large Language Model Applications
-
OSReward: Instituting Standardized Evaluation for Cross-Platform Computer-Use Reward Models
-
JetBrains、AIが少ないトークンでコンテキストを取得しやすく、よりよいコード生成を可能にする「JetBrains Context」発表JetBrains、AIエージェント向け「JetBrains Context」発表、少トークンで文脈提供JetBrainsは、コードリポジトリの上に知的レイヤを構築する新サービス「JetBrains Context」を発表した。AIエージェントに対して適切なコードのコンテキストを少ないトークンで提供することで、より良いコード生成を可能にするという。
-
VAD: Attributing Visual Evidence for Target Reconstruction in Multimodal On-Policy Distillation
-
$β$-OPSD: Deriving with Policy Optimization, Training with Self-Distillation
-
DualG-MRAG: Decoupling Macro-Reasoning and Micro-Matching for Multimodal Retrieval-Augmented Generation
-
Rethinking Inference-Time Scaling in Local Computer-Use Agents: Failure Modes and Compute Tradeoffs
-
Frontis-MA1: Training an AI4AI Model towards Recursive Self-Improvement in Machine Learning Engineering
-
ORCA-bench: How Ready Are Language Model Agents for Oncall?
-
ScaFE: Data-Efficient Scar Classification with LLM-Generated Clinical Feature Programs
-
Graph Neural Network Force Fields for Spin Dynamics in Metallic Magnets
-
MANTA: Multi-Agent Network Topology Adaptation for Self-Evolving Multi-Agent Systems