30-07-2026 17:08 via eweek.com

METR Test Finds OpenAI GPT-5.6 Sol’s Long-Task Score Hinges on Scoring Rules

METR’s evaluation of OpenAI GPT-5.6 Sol found that different scoring methods produced sharply different long-task estimates, raising questions about how enterprises should assess AI-agent reliability.
Read more »