Прогон №1: метод проверен на трёх задачах, на одной разницы почти нет
Заработал стенд. Каждая задача выполняется двумя руками — обычным запросом и запросом по методу — на одной модели, три прогона на руку, по чек-листу, написанному до прогона. Синтетика лежит в репозитории открыто.
Результаты первого прогона.
Протокол совещания: обычный запрос не прошёл чек-лист ни разу из трёх, метод прошёл все три. Ошибки обычного запроса одинаковые от прогона к прогону — модель заполняет пропуски правдоподобным: размытое «сегодня-завтра» превращается в конкретную дату, нераспределённое поручение получает исполнителя, перенесённое обсуждение оформляется как решение.
Сводка по выгрузке: один прогон из трёх против трёх из трёх. Метод выигрывает не потому, что модель «считает точнее», а потому что по методу она не считает вовсе — отдаёт формулу для таблицы, а складывает сама таблица.
Сравнение двух редакций договора: два прогона из трёх против трёх из трёх. Разница на грани различимости, и при трёх повторах она ничего не доказывает. Сравнение текстов — как раз то, что модели даётся хорошо и без всякого метода. Если в следующих прогонах разрыв не появится, честный вывод будет такой: для сравнения документов метод избыточен, достаточно попросить формат ответа.
Изъян, который надо назвать. Обе руки выполняла одна модель, знавшая чек-лист заранее. Это может подтягивать наивную руку вверх — значит, реальная разница не меньше измеренной, но может быть и больше. В следующем прогоне чек-лист и выполнение разводятся по разным сессиям.