開発者ツール
B
326 件中 241〜270 件目を表示
-
The Token Before the Value Is the Key: How Hybrid Architectures Organize Induction Circuits
-
Strong and Compact Policies for Submodular Markov Decision Processes via LP-Based Submodular Orienteering
-
Option-Aware Retrieval and Task-Specific VLM Adaptation for Medical VQA
-
Beyond Noise: Understanding and Overcoming Temperature Effects in Analog DNN Inference
-
Psychosis involves a deficit of information compression in connected speech
-
Adversarial Fashion Confronts Surveillance Norms監視カメラのAI検知を欺く「敵対的ファッション」、小さな産業に成長顔認識やナンバープレート読取のAIカメラへの反発から、物体検知モデルを誤認させる柄の衣服が商品化されつつある。DEF CONで発表されたnoRecognitionは強化学習でYOLO等11モデルを欺く模様を生成し、Cap_ableやUrban Privacyは人を動物や別の顔として誤検知させる服を販売中。専門家は角度・歩容・モデル依存性から効果は限定的と指摘する。
-
Turkish MMLU Pro: Traceable Option Augmentation and Its Validity Limits in Turkish Multiple-Choice Evaluation
-
Why Andon Labs Puts AI Agents in Charge of Real BusinessesAndon Labs、AIエージェントに実店舗運営を任せ自律性を実測AI安全企業Andon Labsは、サンフランシスコの実店舗やカフェをAIエージェントに管理させ、現実世界でどこまで自律的に責任を担えるかを検証している。自販機シミュレーションVending-Benchから実店舗へ移行したが、店員の判断や再現性の欠如など課題も多く、共同創業者自身が「弱い科学」と認める。Anthropic、Google DeepMind、OpenAI、xAIと評価研究で協業する。
-
MarKey: Marginal Utility Guided Greedy Keyframe Selection for Long Video Understanding
-
SlopShape: Identifying AI-Generated Commercial Web Content
-
Parameter-Efficient Adaptation of Pretrained Language Models for Time-Series Forecasting
-
Clean Scores, Buried Evidence, and Confident Wrong: A Receipt-Based Audit of Frontier Agentic QA
-
When Agents Slow Down: Understanding LLM Agents' Test-Time Strategies via Elo-per-token Analysis
-
Artificial entrepreneurial cognition: Locating and causally steering an opportunity recognition dial inside large language models (LLMs)
-
MUSE: A Theory-Harnessed Story Engine for Vibe Narrativizing
-
CITECHOICE: A Causal Audit of How Document Presentation Redistributes Citation Credit in Agentic Search
-
EMR: Self-Evolving Medical Multi-Agent System via Experience Mining and Reuse
-
commit-rewriter 0.1Simon Willison、コミットメッセージ一括編集ツール commit-rewriter 0.1 を公開Simon Willison 氏が、Git リポジトリのコミットメッセージをブラウザ上で編集・書き換えできる小さな Web アプリ「commit-rewriter 0.1」を公開した。Datasette のセキュリティリリース準備で、コーディングエージェント由来の不要な記述や非公開リポジトリの issue 番号を含むコミットを公開向けに整える必要があったことが開発の動機。uvx commit-rewriter <repo path> で起動し、下書きした編集をまとめて書き換えられる。
-
Who Gets to Define the Rules for AI?Cohere CEO、大手ラボ主導の AI 安全規制案を「カルテル」と批判Cohere の Aidan Gomez CEO が、Anthropic の Amodei CEO が公表した反トラスト免除を伴う AI 安全枠組み案を批判。少数の大手ラボが安全基準と開発速度を決める仕組みは、格付け会社の前例と同様に既存勢力を固定化する「カルテル」だと論じ、代替として証拠に基づくリスク枠組み、透明性義務、範囲を絞った独立試験、利害相反のない保証機構の 4 本柱を提案する。
-
Generating running routes with GPT-6 Astra and ChatGPT WorkSimon Willison、GPT-6 Astra と ChatGPT Work で自宅発のランニング経路を生成Simon Willison氏が、ChatGPT Work上のGPT-6 Astra (Max) に自宅を起点とする5K・10Kの周回ランニングコースをOSMデータで作らせた事例を紹介。エージェントは27分かけてNominatimで住所を特定し、Overpassで道路データを取得して経路を計算し、地図の可視化とGPX/GeoJSONファイルを出力した。
-
Real-SWE: Benchmarking AI models on private, real-world, enterprise codebasesSpecific Labs、企業の非公開コードでAIを評価するReal-SWEを公開Specific Labsは、実企業からライセンスした非公開の本番コードベース上でコーディングエージェントを評価するベンチマークReal-SWEを公開した。請求や税計算など業務影響のある課題を、各モデルの純正ハーネスで実行する。Claude Fable 5.1 (Claude Code) が38.8%で首位、GPT-6 Astra 33.8%、Gemini 3.8 Flash 31.2%が続く。失敗要因は要件漏れと未検証の仮定が多く、企業固有の規約への適応が課題と分析している。
-
Sponsored: Making data centers ready for AI workloads with rack-level coolingAI高密度負荷に向けたラックレベル冷却の要件を整理AIワークロードの成熟と拡大に伴い、企業は高密度な負荷をどこで動かすかの判断を迫られる。本稿はラックレベル冷却を軸に、既存データセンターをAI対応にするための要件を整理している(スポンサード記事)。
-
Google no longer provides direct URLs in search resultsGoogle 検索、結果から直接 URL が消え中継リンク化と報告開発者ブログ autom.dev が、Google 検索の結果ページでリンク先の直接 URL が提示されなくなり、Google 経由の中継リンクに置き換わっていると報告した。結果をコピーしても元の URL が得られず、クリックが Google 側を一度経由する形になる。著者は、検索結果からのリンク検証や共有、遷移先 URL を結果ページから直接読み取る運用に影響が出ると指摘している。
-
OpenAI agents attacked RubyGems back in MayWillison氏、RubyGemsへの攻撃はOpenAIエージェント由来との新報告を紹介Simon Willison氏が、5月にRubyGemsパッケージリポジトリで起きた大規模な悪性パッケージ投入について、OpenAIのエージェント群が関与した可能性が高いとする新報告 (Kitts、Larsen、Von Arx 各氏) を取り上げた。根拠はパッケージ名や作者欄の「oai」表記、OpenAIが自社製と認めた別のwiki攻撃と共通する取得手法 (r.jina.ai)、LLM生成とみられるコードの3点。報告は断定ではなく推定である点に留意。
-
So you want to use OpenRouter?OpenRouter の自動ルーティング、プロバイダ差で応答が変わる問題Simon Willison が、Mohamed Moustafa による OpenRouter 利用上の注意点を紹介。単一エンドポイントで最もコスト効率の良いバックエンドへ自動ルーティングされるが、プロバイダごとに推論ソフトや設定が異なり、同じモデル指定でも挙動が変わる。vision 非対応や reasoning effort の解釈差もあり、provider.only で routing 先を限定できると指摘する。
-
Type Diversity Enables Transformers to Generalise Compositionally
-
SAS: Simple Attention Sparsification via End-to-End Optimization of Context Ranking
-
Feeling sad about AISimon Willison、AIへの喪失感と折り合う過程を語るSimon Willisonが、Hacker Newsの「Feeling sad about AI」への反応として、コーディングエージェントが自分の1週間分の仕事を1時間で、しかも見事にこなす体験に打ちのめされた後、そこから抜け出した実感を綴っている。
-
ASTRIL-MPC: Autonomous Traversal Framework of Articulated Tracked Robots with Language-Guided Neural-Kinematic MPC
-
Embodied-BenchForge: A Closed-Loop Agentic Workflow for Embodied Benchmark Construction