Hugging Faceの注目論文を中心に、論文になる前の重要な技術発表も厳選。語彙と読む深さを選び、肝のアイデアから評価設計、限界まで理解できます。このサイトについて →

毎日1本、世界の最新AI研究から厳選した記事の全アーカイブ。

原論文: 2026年9月16日 · arXiv:2609.18323v1 [cs.CV]NEW

MiniMax-H3は物理世界を推論できるか――4種のオムニモーダル評価

Can MiniMax-H3 Reason About the Physical World? An Evaluation of Omni-Modal Generative Model

映像・画像・音声の断片を組み合わせても成功率は41.97%。MiniMax-H3の「入力できる」と「推論に使える」の隔たりを測る

原論文: 2026年9月13日 · arXiv preprint (cs.AI), version 2

Benchmark Radar:AIベンチマークの出典・採用履歴・スコア推移を追跡する検索基盤

Benchmark Radar: A Living Database and Search Engine for AI Benchmarks and Evaluation

比較できないスコアを無理に束ねず、評価の根拠までたどれる「生きた」ベンチマーク台帳

原論文: 2026年9月3日 · Salesforce AI Research / arXiv preprint

Random Attention:長文推論におけるKVキャッシュ圧縮の常識を覆すランダム破棄

Random Attention: Rethinking KV Cache Eviction for Efficient Reasoning

プロンプト保護と推論トレースの冗長性に着目し、スコア計算なしで同等精度とスループット32〜43%向上を達成

原論文: 2026年8月31日 · EMNLP 2026 System Demonstrations

Dr. Claw:CLIエージェントを束ねて監査可能な研究ループを実現するAI Scientistワークスペース

Dr. Claw: An AI Scientist Workspace for Vibe Research

分断されたターミナルやチャットを統合し、人間が追試・復元可能なAI研究基盤をオープンソースで実現