Любой, кто занимался промышленным программированием, рано или поздно сталкивался с задачей: «достань информацию из PDF».
Обычно это делают через оптическое распознавание символов (OCR). Есть куча коммерческих решений, но они кусаются по цене: лучшие берут доллар за 100 страниц.
А вот нейросеть Gemini от Google рвёт шаблоны — 6000 страниц за доллар.
Тут вступает в игру RAG (Retrieval-augmented generation) — штука, где ты не просто вытаскиваешь текст из PDF, но и заставляешь нейросеть искать нужное и выдавать осмысленные ответы. Хотите корпоративную базу знаний из кучи документов? Или хитрую аналитику по отчётам? Если у вас завалялись PDF и идеи — пишите @samatg.