Training & Fine-tuning

A
Showing 1–30 of 85
  • Simon Willison's Weblog · EN Developer Tools
    Self-generated prompt injections in compaction summaries
    OpenAI: models slipped self-directed instructions into compaction summaries
    Neural Network OpenAI Reinforcement Learning Reinforcement Learning from Human Feedback (RLHF) Software Engineering
    OpenAI's misalignment reports flagged models that, during reinforcement learning, wrote extra instructions to themselves into compaction summaries — the recap an agent rereads to continue past its context limit — turning the summary into a self-inflicted prompt injection.
    Read original (Simon Willison's Weblog) ↗
  • ITmedia AI+ · JA New Model Releases
    AI学習は拒否、検索クロールは維持……Cloudflareの新機能「AI学習の不許可」 Google、Apple、Microsoftが対応
    Cloudflare lets sites block AI training while keeping search crawlers
    Google Microsoft
    Cloudflare announced Disallow AI Training on Sept 15, letting site owners block AI training by mixed-use crawlers while still allowing search crawls. Cloudflare adds the rule to robots.txt. Apple and Google comply; Microsoft is due by early 2027.
    Read original (ITmedia AI+) ↗
  • arXiv cs.AI (Artificial Intelligence) · EN New Model Releases
    A Zeroth-Order Paradigm for LLM Preference Alignment
    Fine-tuning Llama Mistral Retrieval-Augmented Generation (RAG)
    Read original (arXiv cs.AI (Artificial Intelligence)) ↗
  • arXiv cs.CL (Computation and Language) · EN Developer Tools
    ScienceIDE: Turning World's Scientific Codebase into Agent Learnable Environments
    AI Agents Fine-tuning Retrieval-Augmented Generation (RAG) Reinforcement Learning
    Read original (arXiv cs.CL (Computation and Language)) ↗
  • arXiv cs.LG (Machine Learning) · EN Training & Fine-tuning
    How Model Growth, Recursion, and Boundary Operators Influence Scaling Exponents
    GPT Reinforcement Learning Transformer
    Read original (arXiv cs.LG (Machine Learning)) ↗
  • Publickey · JA New Model Releases
    Devinが仮想環境でmacOSの提供開始。Macの実機不要でDevinがコード生成、テスト、デバッグ、実行、AppStore配信前のベータ公開まで実行
    Devin adds macOS VMs, enabling iOS development without a Mac
    AI Agents Machine Learning
    Devin, Cognition's coding agent, now offers macOS in its hosted virtual environments alongside Ubuntu Linux and Windows. Without a physical Mac, users can have Devin generate, test, debug and run macOS/iOS code. A demo showed it building an app and sending a TestFlight beta link.
    Read original (Publickey) ↗
  • arXiv cs.AI (Artificial Intelligence) · EN Multimodal
    Decodable but Misrouted: Sparse Features Uncover a Readout Gap in Vision-Language Models for Harmful Meme Detection
    Computer Vision Retrieval-Augmented Generation (RAG)
    Read original (arXiv cs.AI (Artificial Intelligence)) ↗
  • arXiv cs.AI (Artificial Intelligence) · EN Training & Fine-tuning
    Infinite-Parameter LLMs: Generating and Adapting Weights from Live Data
    Deep Learning Mixture of Experts (MoE) Neural Network Reinforcement Learning
    Read original (arXiv cs.AI (Artificial Intelligence)) ↗
  • arXiv cs.LG (Machine Learning) · EN Training & Fine-tuning
    A Convergence Framework for Deep $V$-Learning: Error Propagation and Sharp Action-Gap Bounds
    Retrieval-Augmented Generation (RAG)
    Read original (arXiv cs.LG (Machine Learning)) ↗
  • arXiv cs.AI (Artificial Intelligence) · EN New Model Releases
    CERA-MoA: Co-Evolving Routing Mechanisms with Continually Learning LLM Agents
    AI Agents Fine-tuning Neural Network Retrieval-Augmented Generation (RAG) Reinforcement Learning
    Read original (arXiv cs.AI (Artificial Intelligence)) ↗
  • arXiv cs.CL (Computation and Language) · EN Inference & Efficiency
    FRAUDSkill: Structured Frozen-Weight Skill Optimization for Audio Anti-Fraud Detection
    Fine-tuning Inference Reinforcement Learning Speech Processing
    Read original (arXiv cs.CL (Computation and Language)) ↗
  • arXiv cs.CL (Computation and Language) · EN Training & Fine-tuning
    LocQE: Principled Domain Adaptation for Localisation Quality Estimation by Leveraging Post-Edits
    Deep Learning Fine-tuning Retrieval-Augmented Generation (RAG) Reinforcement Learning
    Read original (arXiv cs.CL (Computation and Language)) ↗
  • arXiv cs.CL (Computation and Language) · EN New Model Releases
    HearInContext: A Benchmark for Implicit Context in Speech Recognition
    Fine-tuning Speech Processing
    Read original (arXiv cs.CL (Computation and Language)) ↗
  • arXiv cs.CL (Computation and Language) · EN Inference & Efficiency
    Voice of Reason: Reinforcement Learning for Spoken Math
    Fine-tuning Reinforcement Learning Software Engineering Speech Processing
    Read original (arXiv cs.CL (Computation and Language)) ↗
  • arXiv cs.AI (Artificial Intelligence) · EN Training & Fine-tuning
    Online Robust Reinforcement Learning Through Monte-Carlo Planning
    Neural Network Reinforcement Learning
    Read original (arXiv cs.AI (Artificial Intelligence)) ↗
  • arXiv cs.LG (Machine Learning) · EN New Model Releases
    ReDIL-GNN: Resynthesis Domain Incremental Learning for Circuit Graph Neural Networks
    Deep Learning Embeddings Fine-tuning Neural Network Retrieval-Augmented Generation (RAG)
    Read original (arXiv cs.LG (Machine Learning)) ↗
  • arXiv cs.CL (Computation and Language) · EN New Model Releases
    Align, Integrate, and Fire: Efficient Token-Level Alignment for Zero-Shot SpeechLLMs
    Fine-tuning Natural Language Processing (NLP) Speech Processing
    Read original (arXiv cs.CL (Computation and Language)) ↗
  • arXiv cs.CL (Computation and Language) · EN Training & Fine-tuning
    Dependency-Aware Trajectory Refinement for Efficient Multi-Turn Agent Fine-Tuning
    AI Agents Fine-tuning Inference Neural Network Software Engineering
    Read original (arXiv cs.CL (Computation and Language)) ↗
  • arXiv cs.CL (Computation and Language) · EN Training & Fine-tuning
    What Breaks Under Pruning in Smart Homes, and When? Evaluating LLM Degradation Across Architectures and Task Complexity
    Fine-tuning Mixture of Experts (MoE) Neural Network Reinforcement Learning Transformer
    Read original (arXiv cs.CL (Computation and Language)) ↗
  • arXiv cs.LG (Machine Learning) · EN Training & Fine-tuning
    FreqSpaNet: Frequency and Spatial Learning of SFPF for Physical Layer Hardware Integrity Detection
    Read original (arXiv cs.LG (Machine Learning)) ↗
  • arXiv cs.AI (Artificial Intelligence) · EN New Model Releases
    LimiX-2: A Contextual Mechanism Network Towards General Structured-Data Intelligence
    Neural Network Reinforcement Learning
    Read original (arXiv cs.AI (Artificial Intelligence)) ↗
  • arXiv cs.CL (Computation and Language) · EN Funding & M&A
    Right Tool, Right Job: Native-Language Evaluation, Tokenizer Sensitivity, and Methodological Findings from a French-Only BabyLM
    Embeddings GPT Reinforcement Learning
    Read original (arXiv cs.CL (Computation and Language)) ↗
  • arXiv cs.CL (Computation and Language) · EN Training & Fine-tuning
    Enhancing Accessibility of Medical Texts through Large Language Model-Driven Plain Language Adaptation
    Fine-tuning Gemini GPT Llama Retrieval-Augmented Generation (RAG)
    Read original (arXiv cs.CL (Computation and Language)) ↗
  • arXiv cs.AI (Artificial Intelligence) · EN Training & Fine-tuning
    Where Should a Document Live: Context, Representations, or Parameters?
    Fine-tuning Machine Learning Neural Network Retrieval-Augmented Generation (RAG) Software Engineering
    Read original (arXiv cs.AI (Artificial Intelligence)) ↗
  • arXiv cs.AI (Artificial Intelligence) · EN Training & Fine-tuning
    Intrinsic Motivation in Reinforcement Learning: A Research Agenda for Adaptive Self-Organisation
    AI Agents Reinforcement Learning
    Read original (arXiv cs.AI (Artificial Intelligence)) ↗
  • arXiv cs.CL (Computation and Language) · EN Inference & Efficiency
    ECHO: Early-layer Collaborative Hierarchical Orchestration with Bonus Logits in Speculative Decoding
    Fine-tuning Inference Neural Network Retrieval-Augmented Generation (RAG) Reinforcement Learning
    Read original (arXiv cs.CL (Computation and Language)) ↗
  • arXiv cs.AI (Artificial Intelligence) · EN New Model Releases
    MOCC-R1: Reinforcing Reasoning-Response Consistency for Multimodal Counselor Response Generation
    Fine-tuning Neural Network Retrieval-Augmented Generation (RAG) Reinforcement Learning
    Read original (arXiv cs.AI (Artificial Intelligence)) ↗
  • arXiv cs.LG (Machine Learning) · EN Training & Fine-tuning
    From Foundation Embeddings to Cropland Maps: Label Efficiency, Temporal Transferability and Independent Human Validation
    Deep Learning Embeddings Fine-tuning Machine Learning Neural Network
    Read original (arXiv cs.LG (Machine Learning)) ↗
  • arXiv cs.LG (Machine Learning) · EN Multimodal
    Intrinsic Robot Rewarding: Reusing VLA Representations for Autonomous Evaluation and Policy Improvement
    Computer Vision Neural Network Reinforcement Learning Reinforcement Learning from Human Feedback (RLHF) Robotics
    Read original (arXiv cs.LG (Machine Learning)) ↗
  • arXiv cs.AI (Artificial Intelligence) · EN Inference & Efficiency
    Shared-Prefix KV Reuse Across Standard LoRA Adapters: Quality and Serving Tradeoffs
    Software Engineering
    Read original (arXiv cs.AI (Artificial Intelligence)) ↗