Для проверки результатов применялся подход LLM-as-a-judge. Самой сильной из доступных моделей отправлялся оригинальный рендер чертежа вместе с вариантами JSON-выводов для сравнения и аудита. Такая методология позволила не только объективно оценить качество извлечения данных (precision/recall), но и выявить конкретные паттерны ошибок. На основе этого фидбека удалось итеративно переписать и значительно улучшить системные промпты, добившись более точного следования формату.
В связи с высокой стоимостью API-запросов к флагманским Vision-моделям, сплошное тестирование абсолютно всех страниц из тестовых PDF-файлов не проводилось. Вместо этого фокус был сделан на точечной проверке самых сложных и насыщенных страниц.
Результаты тестирования средних моделей на сложных страницах (4 страницы) из sample/sample-medium.pdf (подробнее в evalution_result):
| Metric | gpt-5.4 (Ошибки) | gemini-3-flash (Ошибки) |
|---|---|---|
| Precision | 3 | 4 |
| Recall | 19 | 8 |
| Verbatim | 30 | 6 |
| Structure | 6 | 5 |
| ИТОГО ОШИБОК | 58 | 23 |
После улучшений (multi-step, hybrid prompt) (3 страницы):
| Metric | gpt-5.4 (Ошибки) | gemini-3-flash (Ошибки) |
|---|---|---|
| Precision | 4 | 11 |
| Recall | 6 | 0 |
| Verbatim | 8 | 4 |
| Structure | 2 | 1 |
| ИТОГО ОШИБОК | 20 | 16 |
Примечательно, что во втором случае модель-судья вычисляла ошибки весьма специфического характера, например
8.вместо8.(разные типы точек), что говорит о галлюцинации самой модели-судьи (ей не был предоставлен текст). Хотя качество в любом случае улучшилось.
Модель-судья: gemini-3.1-pro-preview.
Ключевое наблюдение, сделанное в ходе тестов: качество парсинга напрямую и критически зависит от размера и сложности (reasoning-способностей) используемой модели.
Сравнительный анализ показал следующее:
- Слабые: Склонны к сильным галлюцинациям при работе с инженерной графикой. Они могут выдумывать несуществующие на чертеже материалы или артикулы деталей, а также полностью ломают структуру сложных таблиц, если ячейки объединены или имеют нестандартную сетку.
- Сильные модели: Демонстрируют высокую точность. Они способны строго следовать правилу извлечения verbatim, корректно дублируют значения для объединенных ячеек и безошибочно сопоставляют annotations с элементами на чертеже.
Для достижения приемлемого в инженерии уровня "нуля придуманных цифр", архитектура решения требует использования передовых VLM-моделей, что напрямую влияет на стоимость инференса.