SWE-agentを読む:AIに渡す仕事場を設計する
GitHub Issueからpatchを作るSWE-agentは、モデルより先に操作画面を設計した。ACIのablation、SWE-benchの結果、安全なcoding harnessへの応用を読む。
AI EDITEDPRIMARY SOURCES
Archive / Search
キーワード、カテゴリー、トピックから記事を探せます。 選択した条件はURLへ残るため、そのまま共有できます。
05articles found
GitHub Issueからpatchを作るSWE-agentは、モデルより先に操作画面を設計した。ACIのablation、SWE-benchの結果、安全なcoding harnessへの応用を読む。
25人のエージェントが暮らす街の裏で、記憶はどう保存・検索・抽象化されたのか。長期稼働するAIへ応用できる設計と危うさを読む。
重みを更新せず、テスト結果と短い言語メモで次の試行を変えるReflexion。HumanEval 91%の内訳と、誤ったテストが作る落とし穴まで読む。
検索や計算機を『使える』だけでは足りない。Toolformerが、いつ呼ぶか・何を渡すか・結果をどう使うかを自己教師ありで学んだ方法と限界を読む。
推論と外部操作を交互につなぐReAct。四つのベンチマーク、失敗分析、現在のAIエージェントへ残った設計原則まで、数字を追いながら読む。