METR Test Finds OpenAI GPT-5.6 Sol’s Long-Task Score Hinges on Scoring Rules
METR’s evaluation of OpenAI GPT-5.6 Sol found that different scoring methods produced sharply different long-task estimates, raising questions about how enterprises should assess AI-agent reliability.
Read more »