
OpenAI、10万人の学術研究者にChatGPT最新モデルを無料提供開始
OpenAIが100万人の学術研究者を対象に、ChatGPTの最新AIモデルへの無料アクセスを開始しました。科学研究の加速化や研究者間の協働を促進する取り組みです。
OpenAIの分析により、人気のコーディングベンチマークSWE-Bench Proの信頼性に関する問題が指摘されています。AIモデル評価の精度をめぐる懸念について解説します。

OpenAIが実施した新しい分析により、広く利用されているコーディングベンチマーク「SWE-Bench Pro」における信頼性と精度に関する問題が明らかになりました。AI言語モデルの能力を測定する際、ベンチマークの正確性は極めて重要です。本記事では、この指摘の背景と、ベンチマーク選択時の注意点について解説します。
コーディングベンチマークは、AIモデルがプログラミングタスクをどの程度正確に実行できるかを測定するための標準的な評価指標です。
OpenAIの分析は、SWE-Bench Proで使用されているテストケースやベンチマーク設計に信頼性に関する懸念があることを示唆しています。このような問題により、ベンチマークスコアがモデルの実際の能力を正確に反映していない可能性が生じます。
具体的には以下の点が影響します:
AIコーディングツールやモデルを評価する際には、単一のベンチマークスコアに頼るのではなく、複数の視点から総合的に判断することが重要です。
ベンチマークは参考情報として有用ですが、それ単独では不十分です。実際の利用環境や業務タスクに即したテストと併用することで、より正確な評価ができます。
コーディング評価には複数のベンチマークが存在します。複数の指標を組み合わせることで、より堅牢な評価判断が可能になります。
OpenAIを含むAI企業は、指摘された問題を改善するための分析と検証を継続しています。ベンチマーク側も問題指摘に応じて改善を進める傾向にあります。

OpenAIが100万人の学術研究者を対象に、ChatGPTの最新AIモデルへの無料アクセスを開始しました。科学研究の加速化や研究者間の協働を促進する取り組みです。

OpenAIと米国心理学会(APA)が青少年のメンタルヘルスに関するAIの影響について協働し、責任あるAI利用のためのエビデンスに基づいたガイダンスとリソースの開発を進めています。

OpenAIが米国エネルギー省と国立研究所と協力し、最先端のAIを活用して科学的発見を加速させるプロジェクトを発表しました。AI技術が基礎科学研究にもたらす可能性について解説します。