Skip to content

Latest commit

 

History

History
39 lines (28 loc) · 4.28 KB

File metadata and controls

39 lines (28 loc) · 4.28 KB

1. Методология оценки

Для проверки результатов применялся подход LLM-as-a-judge. Самой сильной из доступных моделей отправлялся оригинальный рендер чертежа вместе с вариантами JSON-выводов для сравнения и аудита. Такая методология позволила не только объективно оценить качество извлечения данных (precision/recall), но и выявить конкретные паттерны ошибок. На основе этого фидбека удалось итеративно переписать и значительно улучшить системные промпты, добившись более точного следования формату.

2. Eval

В связи с высокой стоимостью API-запросов к флагманским Vision-моделям, сплошное тестирование абсолютно всех страниц из тестовых PDF-файлов не проводилось. Вместо этого фокус был сделан на точечной проверке самых сложных и насыщенных страниц.

Результаты тестирования средних моделей на сложных страницах (4 страницы) из sample/sample-medium.pdf (подробнее в evalution_result):

Metric gpt-5.4 (Ошибки) gemini-3-flash (Ошибки)
Precision 3 4
Recall 19 8
Verbatim 30 6
Structure 6 5
ИТОГО ОШИБОК 58 23

После улучшений (multi-step, hybrid prompt) (3 страницы):

Metric gpt-5.4 (Ошибки) gemini-3-flash (Ошибки)
Precision 4 11
Recall 6 0
Verbatim 8 4
Structure 2 1
ИТОГО ОШИБОК 20 16

Примечательно, что во втором случае модель-судья вычисляла ошибки весьма специфического характера, например 8. вместо 8. (разные типы точек), что говорит о галлюцинации самой модели-судьи (ей не был предоставлен текст). Хотя качество в любом случае улучшилось.

Модель-судья: gemini-3.1-pro-preview.

3. Выводы: Зависимость качества от выбора модели

Ключевое наблюдение, сделанное в ходе тестов: качество парсинга напрямую и критически зависит от размера и сложности (reasoning-способностей) используемой модели.

Сравнительный анализ показал следующее:

  • Слабые: Склонны к сильным галлюцинациям при работе с инженерной графикой. Они могут выдумывать несуществующие на чертеже материалы или артикулы деталей, а также полностью ломают структуру сложных таблиц, если ячейки объединены или имеют нестандартную сетку.
  • Сильные модели: Демонстрируют высокую точность. Они способны строго следовать правилу извлечения verbatim, корректно дублируют значения для объединенных ячеек и безошибочно сопоставляют annotations с элементами на чертеже.

Для достижения приемлемого в инженерии уровня "нуля придуманных цифр", архитектура решения требует использования передовых VLM-моделей, что напрямую влияет на стоимость инференса.