
Вышел любопытный опенсорсный бенчмарк BullshitBench, который тестирует модели на критическое мышление. Вместо обычных задач им подсовывают 100 вопросов-ловушек с абсурдными или ложными вводными. Проверка идет по пяти серьезным темам — от медицины и физики до финансов. Цель простая — понять, распознает ли ИИ чушь или начнет вежливо «помогать» решать несуществующую проблему.
Система оценки тут строгая. Ответы прогоняют через судейскую панель из топовых моделей вроде GPT-5.2 и Claude 4.6. В свежем обновлении лидерборда от 4 марта уже засветились новейшие GPT-5.3 и превью-версия Gemini 3.1. На мой взгляд, это куда важнее стандартных тестов на эрудицию. Умная модель обязана уметь давать четкий отпор бреду, а не просто поддакивать пользователю в любой непонятной ситуации. 🧠











