Perceptron Mk1 (Mark One) — это зрение-языковая модель высочайшего качества от Perceptron для видео и воплощённого рассуждения.** Она принимает изображения и видео вместе с запросами на естественном языке и выдаёт подробные ответы с пониманием визуальной информации — либо в структурированной форме, либо на естественном языке. Она превосходно справляется с задачами понимания видео, такими как видео QA, суммаризация и обнаружение событий. Для изображений она развивает точечную привязку по примерам из мультимодальных подсказок, OCR и разбор документов на «зашумлённых» реальных входных данных, обнаружение и подсчёт объектов с открытым словарём, а также оценку позы рук. Рассуждение может быть включено по запросу, чтобы обменять задержку на более глубокий анализ более сложных задач. Структурированные аннотации выводятся в тексте только в том случае, если это явно запрошено через параметр annotation_format (передайте "point", "box" или "polygon" для пространственной локализации на изображениях, или "clip" (временные метки начала/конца) для временных сегментов в видео). Без annotation_format модель возвращает только текст на естественном языке.
автор perceptron•12 мая 2026 г.•18,57 ₽ / 1 млн входных185,66 ₽ / 1 млн выходных