AI
AI研究エージェントが10種の安全性の問題でモデルを改善
AI研究エージェントが、安全性に関わる10種類の問題について訓練法を探索し、対象ベンチマークでモデルの成績を改善した。Anthropicの実験で…
TOPIC
AI研究エージェントが、安全性に関わる10種類の問題について訓練法を探索し、対象ベンチマークでモデルの成績を改善した。Anthropicの実験で…
科学者向けのClaudeサブスクリプション1万席が、1年間の無料・割引枠として開放された。研究室の利用量が通常枠を超えれば、研究課題ごとに最大5…
Claudeの実利用を、会話原文を外部へ渡さずに研究する試行が行われた。外部3研究機関が課題を自ら設計し、集計結果を独立して分析した。利用者によ…
AIモデルが設計した小型タンパク質を実験室で評価し、15種類の標的のうち14種類に結合する設計が確認された。設計条件により、個々の候補が結合した…
鍵と直前の文脈で語の選び方を決め、生成後の語列からAIの関与可能性を調べるテキスト透かしがClaudeの将来モデルに導入される。文字や隠し文字は…
AI代理人同士の協調は、脆弱性探索と共同開発で異なる結果を示した。Anthropicの実験では、共有掲示板で連携した代理人群が脆弱性を発見する一…
言語モデルClaudeの内部で、出力されない概念や多段階推論を保持する小規模な表現群「J-space」が見つかった。読み出しと介入の実験は、この…