ModLens: зрение для текстовых моделей
Vision-плагин, который даёт текстовым моделям DeepSeek и GLM возможность читать изображения напрямую в чате без сохранения файлов.
privacy
Эта заметка участвует в semantic memory.
AI Summary
ModLens — это плагин для DeepSeek Harness (dsh), который добавляет возможность чтения изображений текстовым моделям DeepSeek и GLM. Плагин работает без изменения конфигурации хоста, не требует прокси-демонов и хуков. Установка одной командой: npx -y @deepseek-ai/dsh plugin --profile web add @liustack/modlens@3.18.1. Поддерживает 6 встроенных провайдеров (gemini-api, openai, anthropic, antigravity-cli, claude-cli, kimi-cli) и 4 переиспользуемых CLI (Codex, OpenCode, Pi, Grok). При вставке изображения создаёт структурированный вывод: полная транскрипция, регионы разметки, списки сущностей и отношений. Модель цитирует конкретные детали. Failover-цепочка: быстрые API-провайдеры → CLI-агенты. Конфигурация через modlens config set, поддержка прокси. Работает в Claude Code, Codex, Pi, OpenCode. Вывод в JSON с метаданными попыток и предупреждений. Автор не принимает PR, только issues. MIT-лицензия.