Бенчмарк повторных прогонов
Каждый случай проходит полный путь: подписанный манифест, изолированная песочница, скрытые тесты, подписанная квитанция. Мы публикуем, где система отказывается решать и где она пока ошибается.
По категориям
| Категория | Верный исход |
|---|
Все случаи
| Случай | Что проверяет | Ожидалось | Получено | Совпало |
|---|
Что изменилось после первого прогона
- Подделка отчёта закрыта для тестов «чёрного ящика». С обычными тестами проверяемый код работает в том же процессе pytest и может подделать весь результат (
shop/forge-exit, оставлен как ложный PASS намеренно). В режиме «чёрного ящика» кандидат запускается в отдельном процессе без доступа к каналу отчёта; та же атака и две более сильные теперь дают FAIL (shop-bb/*). - Три прогона кандидата. FAIL ставится, только если упали все прогоны, поэтому тест, падающий случайно в 30% случаев, бракует верный код примерно в 2,7% работ (0,3³) вместо 9% при двух прогонах, с которых мы начинали.
- Нарушены лимиты в любом прогоне — FAIL. Форк-бомба, которую удержали лишь в части прогонов, раньше считалась «невоспроизводимой».
- Реальные репозитории. Исправления багов из toolz, boltons и more-itertools; для каждого проверено, что тест падает до фикса и проходит после. Пока только небольшие, хорошо протестированные библиотеки — крупные репозитории дальше.