推論・効率化

A
94 件中 1〜30 件目を表示
  • Hacker News (Front Page) · EN 推論・効率化
    DeepSeek-v4.1 Flash: Pushing the Limits of KV Cache Compression
    DeepSeek-V4.1 Flash、KV キャッシュを 4 倍圧縮し推論を高速化
    DeepSeek
    DeepSeek-V4.1 Flash の技術報告を読み解いた解説記事。長時間稼働するエージェント用途で肥大化する KV キャッシュと prefill 計算負荷を抑えることが狙いで、YOCO に倣い全 40 層のうち prefill では 20 層のみを使い活性パラメータを 8B (decode は 16B) に抑える。さらに GQA 的なヘッド数圧縮、層をまたぐ CSA2 のブロック圧縮、FP4 KV キャッシュを組み合わせ、タスク品質を保ったまま KV キャッシュを約 4 倍圧縮したと整理する。
    元記事を読む (Hacker News (Front Page)) ↗
  • ITmedia AI+ · JA 新モデル・リリース
    「中国AIがClaudeやGPTから数十億トークン抽出」 米当局が暴いた「知識蒸留」の実態
    米NSA・CISA・FBI、中国AI企業による米モデルからの知識蒸留で共同勧告
    Claude GPT 推論 (Inference)
    米国のNSA、CISA、FBIは、中国のAI企業が米国のフロンティアモデルから組織的に「知識蒸留」を行っているとして共同勧告を公開した。プロキシ経由で推論機能などを抽出していると指摘し、対抗措置を推奨している。
    元記事を読む (ITmedia AI+) ↗
  • NVIDIA Developer Blog · EN 推論・効率化
    TensorRT Edge-LLM Completes the MLPerf Edge Agentic Benchmark 6.4x Faster on Jetson AGX Thor
    NVIDIA、MLPerf エッジ agent ベンチを Jetson Thor で 6.4 倍高速化
    AI エージェント 生成 AI 推論 (Inference) NVIDIA ソフトウェア工学
    NVIDIA は MLPerf Inference v6.1 の Edge Agentic ベンチで、Qwen3.6-27B を Jetson AGX Thor 1 台で走らせ 1,007 ターンを 24 分 36 秒で完走。llama.cpp 参照実装 (2 時間 37 分) の 6.4 倍で、BFCL 精度は 87.94%。NVFP4 量子化、ツリー型 MTP、KV キャッシュ再利用の併用による。
    元記事を読む (NVIDIA Developer Blog) ↗
  • arXiv cs.AI (Artificial Intelligence) · EN 推論・効率化
    rMuscle: Robotic Muscle Memory for Efficient Vision-Language-Action Model Inference
    コンピュータビジョン 推論 (Inference) 強化学習
    元記事を読む (arXiv cs.AI (Artificial Intelligence)) ↗
  • arXiv cs.CL (Computation and Language) · EN 推論・効率化
    Long-Lived Characters, Local Inference: Incremental Memory Maintenance for Game NPCs
    推論 (Inference) 量子化
    元記事を読む (arXiv cs.CL (Computation and Language)) ↗
  • arXiv cs.CL (Computation and Language) · EN 新モデル・リリース
    Structured Claim-Level Discourse Representations for Dense Health Narratives
    推論 (Inference) ニューラルネットワーク 検索拡張生成 (RAG)
    元記事を読む (arXiv cs.CL (Computation and Language)) ↗
  • arXiv cs.AI (Artificial Intelligence) · EN マルチモーダル
    Decodable but Misrouted: Sparse Features Uncover a Readout Gap in Vision-Language Models for Harmful Meme Detection
    コンピュータビジョン 検索拡張生成 (RAG)
    元記事を読む (arXiv cs.AI (Artificial Intelligence)) ↗
  • arXiv cs.AI (Artificial Intelligence) · EN 推論・効率化
    Taming the Agentic RAN: Stability-Guaranteed Arbitration of Autonomous AI Agents in O-RAN
    AI エージェント ニューラルネットワーク OpenAI
    元記事を読む (arXiv cs.AI (Artificial Intelligence)) ↗
  • arXiv cs.AI (Artificial Intelligence) · EN 推論・効率化
    Ask the Tool, Don't Guess: Agent Tool Calls Hold Their Progress, and the Serving System Should Read It
    ニューラルネットワーク ソフトウェア工学
    元記事を読む (arXiv cs.AI (Artificial Intelligence)) ↗
  • arXiv cs.CL (Computation and Language) · EN 推論・効率化
    FRAUDSkill: Structured Frozen-Weight Skill Optimization for Audio Anti-Fraud Detection
    ファインチューニング 推論 (Inference) 強化学習 音声処理
    元記事を読む (arXiv cs.CL (Computation and Language)) ↗
  • arXiv cs.AI (Artificial Intelligence) · EN 推論・効率化
    A Scalable Framework for Automated NER Annotation Correction in Low-Resource Languages
    推論 (Inference) ニューラルネットワーク 自然言語処理 (NLP) 検索拡張生成 (RAG)
    元記事を読む (arXiv cs.AI (Artificial Intelligence)) ↗
  • arXiv cs.AI (Artificial Intelligence) · EN 新モデル・リリース
    Clueing up LLMs with Tool-Augmented Deductive Reasoning
    AI エージェント Gemini GPT 推論 (Inference)
    元記事を読む (arXiv cs.AI (Artificial Intelligence)) ↗
  • arXiv cs.AI (Artificial Intelligence) · EN 新モデル・リリース
    Beyond Truncation: Rethinking LLM Decoding as Ensemble Pruning
    埋め込み (Embeddings) 推論 (Inference) 強化学習
    元記事を読む (arXiv cs.AI (Artificial Intelligence)) ↗
  • arXiv cs.LG (Machine Learning) · EN 新モデル・リリース
    Toward Composable Network Digital Twins: A Subgraph-Based Latency Prediction Study
    機械学習 強化学習
    元記事を読む (arXiv cs.LG (Machine Learning)) ↗
  • arXiv cs.CL (Computation and Language) · EN マルチモーダル
    RankGround: Efficient High-Resolution GUI Grounding via Lightweight Reranker-Guided Crop Selection
    AI エージェント コンピュータビジョン 推論 (Inference) 検索拡張生成 (RAG)
    元記事を読む (arXiv cs.CL (Computation and Language)) ↗
  • arXiv cs.AI (Artificial Intelligence) · EN 新モデル・リリース
    Generalist-Specialist Mixture-of-Experts for Rare Pathology Detection in Multimodal Imaging
    推論 (Inference) Mixture of Experts (MoE) 強化学習
    元記事を読む (arXiv cs.AI (Artificial Intelligence)) ↗
  • arXiv cs.CL (Computation and Language) · EN 推論・効率化
    Voice of Reason: Reinforcement Learning for Spoken Math
    ファインチューニング 強化学習 ソフトウェア工学 音声処理
    元記事を読む (arXiv cs.CL (Computation and Language)) ↗
  • arXiv cs.AI (Artificial Intelligence) · EN 推論・効率化
    Beyond EER: Multi-Dimensional Evaluation of Information Leakage in Speaker De-Identification
    埋め込み (Embeddings) 推論 (Inference) ニューラルネットワーク 音声処理
    元記事を読む (arXiv cs.AI (Artificial Intelligence)) ↗
  • arXiv cs.CL (Computation and Language) · EN インフラ・ハードウェア
    Selection Is Retrieval, Abstention Is Not: On-Device Tool Routing over 70 Korean-English Actions
    ニューラルネットワーク 強化学習 ソフトウェア工学
    元記事を読む (arXiv cs.CL (Computation and Language)) ↗
  • arXiv cs.LG (Machine Learning) · EN 推論・効率化
    VLA-ULAP: Interleaving Cloud VLA Calls with Ultra-Lightweight Local Action Prediction at the Edge
    推論 (Inference) 強化学習
    元記事を読む (arXiv cs.LG (Machine Learning)) ↗
  • arXiv cs.LG (Machine Learning) · EN 推論・効率化
    Peak-Aware Short-Term Load Forecasting Across Distribution Grid Aggregation Levels
    推論 (Inference) 機械学習 強化学習
    元記事を読む (arXiv cs.LG (Machine Learning)) ↗
  • arXiv cs.LG (Machine Learning) · EN 新モデル・リリース
    TTM-Bench: A Framework for Text-to-Music System Performance Benchmarking
    機械学習 ニューラルネットワーク 検索拡張生成 (RAG)
    元記事を読む (arXiv cs.LG (Machine Learning)) ↗
  • arXiv cs.AI (Artificial Intelligence) · EN 政策・規制
    On-the-Fly Homographies Calibration for Multi-Camera Tracking
    Meta
    元記事を読む (arXiv cs.AI (Artificial Intelligence)) ↗
  • arXiv cs.CL (Computation and Language) · EN 新モデル・リリース
    Align, Integrate, and Fire: Efficient Token-Level Alignment for Zero-Shot SpeechLLMs
    ファインチューニング 自然言語処理 (NLP) 音声処理
    元記事を読む (arXiv cs.CL (Computation and Language)) ↗
  • arXiv cs.CL (Computation and Language) · EN 推論・効率化
    Size Matters: Foundation Model for Czech HTML documents
    機械学習 強化学習
    元記事を読む (arXiv cs.CL (Computation and Language)) ↗
  • arXiv cs.CL (Computation and Language) · EN 推論・効率化
    ActionPiece: Rethinking Action Tokenization for Autoregressive Vision-Language-Action Models
    コンピュータビジョン 量子化
    元記事を読む (arXiv cs.CL (Computation and Language)) ↗
  • arXiv cs.CL (Computation and Language) · EN 学習・ファインチューニング
    Dependency-Aware Trajectory Refinement for Efficient Multi-Turn Agent Fine-Tuning
    AI エージェント ファインチューニング 推論 (Inference) ニューラルネットワーク ソフトウェア工学
    元記事を読む (arXiv cs.CL (Computation and Language)) ↗
  • Google Research Blog · EN 推論・効率化
    Bypassing inference bottlenecks: Accelerating complex AI search with Retrieve-for-Train
    Google、推論時思考を回避する検索枠組み Retrieve-for-Train
    アルゴリズム・理論 データマイニング 生成 AI 推論 (Inference)
    Google Research が、AI 検索・推薦で一貫した結果セットを返す枠組み Retrieve-for-Train を公開した。推論時に高コストな自己回帰的推論を重ねる代わりに、強化学習で軽量な拡散モデルを一度学習させ、補完関係にある結果群をまとめて即座に生成する。キャンプ用品の検索でテント・寝袋・コンロを揃えて返すような用途を想定する。
    元記事を読む (Google Research Blog) ↗
  • arXiv cs.AI (Artificial Intelligence) · EN 推論・効率化
    LACE: Layer-Wise Compression for Dynamic Frame Rate Codecs
    埋め込み (Embeddings) 推論 (Inference) 量子化 音声処理
    元記事を読む (arXiv cs.AI (Artificial Intelligence)) ↗
  • arXiv cs.AI (Artificial Intelligence) · EN 推論・効率化
    JustFit: 200K-Token LLM Serving on a 24 GiB Laptop with Just-in-Time State Management
    推論 (Inference) 機械学習 ニューラルネットワーク 量子化 ソフトウェア工学
    元記事を読む (arXiv cs.AI (Artificial Intelligence)) ↗