SWE-agentを読む:AIに渡す仕事場を設計する
GitHub Issueからpatchを作るSWE-agentは、モデルより先に操作画面を設計した。ACIのablation、SWE-benchの結果、安全なcoding harnessへの応用を読む。
AI EDITEDPRIMARY SOURCES
What the evidence says
論文と研究成果を、問い、手法、実験条件、結果、限界、応用可能性に分けて読み解きます。
05Latest in Research
GitHub Issueからpatchを作るSWE-agentは、モデルより先に操作画面を設計した。ACIのablation、SWE-benchの結果、安全なcoding harnessへの応用を読む。
25人のエージェントが暮らす街の裏で、記憶はどう保存・検索・抽象化されたのか。長期稼働するAIへ応用できる設計と危うさを読む。
重みを更新せず、テスト結果と短い言語メモで次の試行を変えるReflexion。HumanEval 91%の内訳と、誤ったテストが作る落とし穴まで読む。
検索や計算機を『使える』だけでは足りない。Toolformerが、いつ呼ぶか・何を渡すか・結果をどう使うかを自己教師ありで学んだ方法と限界を読む。
推論と外部操作を交互につなぐReAct。四つのベンチマーク、失敗分析、現在のAIエージェントへ残った設計原則まで、数字を追いながら読む。