安全性・評価

A
58 件中 31〜58 件目を表示
  • arXiv cs.LG (Machine Learning) · EN 新モデル・リリース
    Privacy-Aligned Personalized Federated Learning with Compact Adaptation and Variable-Length Gaussian Communication
    深層学習 量子化
    元記事を読む (arXiv cs.LG (Machine Learning)) ↗
  • arXiv cs.AI (Artificial Intelligence) · EN 安全性・評価
    Recurrent GraphNeural NetworkswithSet-BasedAggregation
    ニューラルネットワーク 検索拡張生成 (RAG)
    元記事を読む (arXiv cs.AI (Artificial Intelligence)) ↗
  • arXiv cs.LG (Machine Learning) · EN 新モデル・リリース
    Safe Meta-Reinforcement Learning via Information Space Reachability
    AI エージェント Meta 検索拡張生成 (RAG) 強化学習
    元記事を読む (arXiv cs.LG (Machine Learning)) ↗
  • arXiv cs.CL (Computation and Language) · EN 安全性・評価
    Inoculation Midtraining with Learned Neologisms
    ファインチューニング 強化学習
    元記事を読む (arXiv cs.CL (Computation and Language)) ↗
  • arXiv cs.AI (Artificial Intelligence) · EN 学習・ファインチューニング
    K-Bench: a clinically calibrated benchmark for evaluating large language models in high-risk mental health conversations
    GPT 検索拡張生成 (RAG) 強化学習
    元記事を読む (arXiv cs.AI (Artificial Intelligence)) ↗
  • arXiv cs.AI (Artificial Intelligence) · EN 安全性・評価
    CiteGuard-RAG: A Validation-Centered AI System for Evidence-Grounded Question Answering
    検索拡張生成 (RAG) ソフトウェア工学
    元記事を読む (arXiv cs.AI (Artificial Intelligence)) ↗
  • arXiv cs.LG (Machine Learning) · EN 安全性・評価
    Sharp Rates and a One-Line Correction for Spectral Representation Learning
    元記事を読む (arXiv cs.LG (Machine Learning)) ↗
  • arXiv cs.AI (Artificial Intelligence) · EN エージェント・ツール使用
    Delegating Authorization to Misaligned Agents: Coalitional Alignment and Safe Control
    AI エージェント ニューラルネットワーク 検索拡張生成 (RAG)
    元記事を読む (arXiv cs.AI (Artificial Intelligence)) ↗
  • arXiv cs.AI (Artificial Intelligence) · EN 業界導入・応用
    KnowBench: Effort Reduction as a Unified, Deployment-Grounded Benchmark for Clinical AI
    深層学習 ニューラルネットワーク
    元記事を読む (arXiv cs.AI (Artificial Intelligence)) ↗
  • arXiv cs.AI (Artificial Intelligence) · EN 推論・効率化
    Look Before You Leap: Factual Decoding with Internal Attribution Signals
    推論 (Inference) 機械学習 検索拡張生成 (RAG) 強化学習
    元記事を読む (arXiv cs.AI (Artificial Intelligence)) ↗
  • arXiv cs.LG (Machine Learning) · EN 学習・ファインチューニング
    Principal-timestep Restricted Init via Sparse Matrix-decomposition in Flow-matching
    ファインチューニング ニューラルネットワーク
    元記事を読む (arXiv cs.LG (Machine Learning)) ↗
  • arXiv cs.LG (Machine Learning) · EN 新モデル・リリース
    The Misery of Mechanistic Interpretability: A Formal Perspective
    GPT Llama ニューラルネットワーク
    元記事を読む (arXiv cs.LG (Machine Learning)) ↗
  • arXiv cs.CL (Computation and Language) · EN 安全性・評価
    Beyond Safe Answers: Segment-Aware Listwise Alignment for Reasoning Safety in Large Reasoning Models
    人間のフィードバックによる強化学習 (RLHF) ソフトウェア工学
    元記事を読む (arXiv cs.CL (Computation and Language)) ↗
  • IEEE Spectrum (AI section) · EN エージェント・ツール使用
    Why Andon Labs Puts AI Agents in Charge of Real Businesses
    Andon Labs、AIエージェントに実店舗運営を任せ自律性を実測
    AI エージェント Anthropic Claude Google OpenAI
    AI安全企業Andon Labsは、サンフランシスコの実店舗やカフェをAIエージェントに管理させ、現実世界でどこまで自律的に責任を担えるかを検証している。自販機シミュレーションVending-Benchから実店舗へ移行したが、店員の判断や再現性の欠如など課題も多く、共同創業者自身が「弱い科学」と認める。Anthropic、Google DeepMind、OpenAI、xAIと評価研究で協業する。
    元記事を読む (IEEE Spectrum (AI section)) ↗
  • Cohere Blog · EN 安全性・評価
    Who Gets to Define the Rules for AI?
    Cohere CEO、大手ラボ主導の AI 安全規制案を「カルテル」と批判
    強化学習
    Cohere の Aidan Gomez CEO が、Anthropic の Amodei CEO が公表した反トラスト免除を伴う AI 安全枠組み案を批判。少数の大手ラボが安全基準と開発速度を決める仕組みは、格付け会社の前例と同様に既存勢力を固定化する「カルテル」だと論じ、代替として証拠に基づくリスク枠組み、透明性義務、範囲を絞った独立試験、利害相反のない保証機構の 4 本柱を提案する。
    元記事を読む (Cohere Blog) ↗
  • arXiv cs.CL (Computation and Language) · EN 安全性・評価
    SAS: Simple Attention Sparsification via End-to-End Optimization of Context Ranking
    検索拡張生成 (RAG) Transformer
    元記事を読む (arXiv cs.CL (Computation and Language)) ↗
  • Simon Willison's Weblog · EN 安全性・評価
    Quoting Boris Cherny
    Boris Cherny、Claude 製の本番コードは人間より高い基準が必要と指摘
    AI エージェント Anthropic Claude ニューラルネットワーク
    Simon Willison が Anthropic の Boris Cherny の発言を引用。Claude が書いた本番コードは人間が書いたものより高い基準を課すべきだとし、Anthropic 社内では多数の lint ルールとテスト、Claude 主導の E2E テスト、日次で走る Claude 製ファザー、自動コードレビューとセキュリティレビュー、自動リファクタリングを敷いていると述べる。こうした仕組みがなければ保守困難なコードに陥ると警告する。
    元記事を読む (Simon Willison's Weblog) ↗
  • arXiv cs.AI (Artificial Intelligence) · EN 新モデル・リリース
    CMA-OT: Hierarchical Expert Supervision for Dance-to-Music Generation
    検索拡張生成 (RAG) 強化学習
    元記事を読む (arXiv cs.AI (Artificial Intelligence)) ↗
  • arXiv cs.AI (Artificial Intelligence) · EN 安全性・評価
    ASTRIL-MPC: Autonomous Traversal Framework of Articulated Tracked Robots with Language-Guided Neural-Kinematic MPC
    ニューラルネットワーク
    元記事を読む (arXiv cs.AI (Artificial Intelligence)) ↗
  • arXiv cs.AI (Artificial Intelligence) · EN 新モデル・リリース
    MAxBench: A Multinomial Concept Recovery Benchmark
    Meta
    元記事を読む (arXiv cs.AI (Artificial Intelligence)) ↗
  • arXiv cs.AI (Artificial Intelligence) · EN 安全性・評価
    Unified CT and MRI Pancreas Segmentation for Label-Efficient Cross-Modality Subregion Transfer
    ニューラルネットワーク 検索拡張生成 (RAG)
    元記事を読む (arXiv cs.AI (Artificial Intelligence)) ↗
  • arXiv cs.AI (Artificial Intelligence) · EN 安全性・評価
    Comfort by Construction: Adaptive, Comfort-Bounded Action Spaces for Learned Driving Policies
    元記事を読む (arXiv cs.AI (Artificial Intelligence)) ↗
  • arXiv cs.AI (Artificial Intelligence) · EN 新モデル・リリース
    ARC: Autonomous Robotics Compliance A Three-Layer Governance Architecture for Deployed Autonomous Systems
    ロボティクス
    元記事を読む (arXiv cs.AI (Artificial Intelligence)) ↗
  • arXiv cs.AI (Artificial Intelligence) · EN 安全性・評価
    3D CT-to-PET Translation via Latent Brownian Bridge Diffusion
    深層学習 Meta ニューラルネットワーク
    元記事を読む (arXiv cs.AI (Artificial Intelligence)) ↗
  • arXiv cs.AI (Artificial Intelligence) · EN 推論・効率化
    A Graph-Based Approach for Mapping Kernel-Level Telemetry to MITRE ATT&CK
    推論 (Inference) 検索拡張生成 (RAG)
    元記事を読む (arXiv cs.AI (Artificial Intelligence)) ↗
  • arXiv cs.AI (Artificial Intelligence) · EN マルチモーダル
    Online Video Agent Harness for Long Video Understanding
    AI エージェント 深層学習 ニューラルネットワーク ソフトウェア工学 音声処理
    元記事を読む (arXiv cs.AI (Artificial Intelligence)) ↗
  • arXiv cs.AI (Artificial Intelligence) · EN マルチモーダル
    Assisted Spatial Cognition Through Vision-Language Models
    コンピュータビジョン 強化学習
    元記事を読む (arXiv cs.AI (Artificial Intelligence)) ↗
  • arXiv cs.AI (Artificial Intelligence) · EN 安全性・評価
    When Rubrics Fail: Hallucinations Reveal Blind Spots in Medical AI Evaluation
    ヘルスケア・バイオ
    元記事を読む (arXiv cs.AI (Artificial Intelligence)) ↗