LangExtract: извлечение данных из текста с LLM
LangExtract — Python-библиотека для структурированного извлечения информации из неструктурированных текстов с помощью LLM, с точным grounding'ом, визуализацией и поддержкой локальных/облачных моделей.
AI Summary
📖 Обзор: LangExtract — мощная Python-библиотека для извлечения структурированной информации из неструктурированных текстов (клинические заметки, отчеты, литература) с использованием LLM. Работает по few-shot примерам: определяешь промпт и примеры экстракций — библиотека генерирует точные результаты с привязкой к исходному тексту (char_interval), визуализацией в HTML и фильтрацией 'галлюцинаций'. Поддерживает облачные модели (Gemini via API), локальные LLM через Ollama, чанкинг для длинных документов и параллельную обработку. Примеры: полное извлечение 'Ромео и Джульетты', медикаменты, структуризация радиологических отчетов (RadExtract). Код минималистичен: промпт + примеры → lx.extract().
🔑 Ключевые фичи и выводы: • 🎯 Precise Grounding: Каждая экстракция привязана к точному месту в тексте (char_interval); неgrounded — None, легко фильтровать. • 🛠️ Few-shot Schema: Контролируемый вывод по примерам; предупреждения о несоответствиях промпта. • 📊 Визуализация: Интерактивный HTML для тысяч сущностей в контексте. • ⚡ Long Docs: Чанкинг + multi-pass для высокой recall в больших текстах. • 🤖 Модели: Gemini, Ollama (локально), кастомные провайдеры; API key для облака. • 🎭 Универсальность: Любая доменная задача без fine-tuning; LLM-знания по промпту.