Загрузка...

Каталог AI моделей и нейросетей: сравнение и цены

Каталог нейросетей с описанием возможностей и ценами в рублях. Сравните стоимость токенов и выберите лучшее решение.

  • Логотип Mistral AI

    Voxtral Mini Transcribe

    Mistral AI
    Скопировано!

    Voxtral Mini Transcribe — это модель преобразования речи в текст от Mistral, созданная на основе семейства Voxtral Mini. Она принимает аудиовход и возвращает транскрибированный текст через стандартный API транскрипции. Подходит для транскрибирования встреч, голосовых заметок, подкастов и другого устного контента.

    Входные данные:
    • Аудио
    Исходящие данные:
    • Транскрибация
  • Логотип SpaceXAI

    Grok Voice TTS 1.0

    SpaceXAI
    Скопировано!

    Grok Voice TTS 1.0 — это модель преобразования текста в речь от xAI. Она преобразует текст в аудио на более чем 20 языках с автоматическим определением языка и предлагает пять встроенных голосов (Eve, Ara, Rex, Sal, Leo), охватывающих различные тона. Встроенные теги речи позволяют управлять паузами, акцентами, высотой тона, скоростью и стилем голоса. Выходные данные доступны в форматах MP3, WAV, PCM, μ-law и A-law с частотой дискретизации от 8 кГц до 48 кГц, с возможностью обработки до 15 000 символов за запрос.

    Входные данные:
    • Текст
    Исходящие данные:
    • Речь
  • Логотип Qwen

    Qwen3 ASR Flash

    Qwen
    Скопировано!

    Qwen3-ASR-Flash — это служба автоматического распознавания речи от Alibaba, основанная на платформе Qwen3-Omni и обученная на десятках миллионов часов мультимодальных речевых данных. Модель поддерживает 11 языков — включая китайский (с кантонским, сычуаньским, миньнаньским и у диалектами), английский, арабский, французский, немецкий, испанский, итальянский, португальский, русский, японский и корейский — с автоматическим определением языка, так что ручная настройка не требуется для аудио с несколькими языками.

    Модель предназначена для сложных акустических условий: она транскрибирует тексты песен на фоне музыки, обрабатывает шумные и дальние записи, фильтрует тишину и неречевые звуки, а также принимает произвольный контекстный текст (имена, жаргон, терминология домена), чтобы склонить распознавание в сторону определенного словаря.

    Входные данные:
    • Аудио
    Исходящие данные:
    • Транскрибация
  • Логотип Recraft

    Recraft V4.1 Pro Vector

    Recraft
    Скопировано!

    Recraft V4.1 Pro Vector — это векторный (SVG) вариант Recraft V4.1 Pro, настроенный на высокую эстетику. Он поддерживает ввод текста и изображений и обеспечивает вывод SVG изображений с более высоким разрешением…

    Входные данные:
    • Текст
    • Изображения
    Исходящие данные:
    • Изображения
  • Логотип Recraft

    Recraft V4.1 Vector

    Recraft
    Скопировано!

    Recraft V4.1 Vector — это векторный (SVG) вариант Recraft V4.1, настроенный на высокую эстетику. Он поддерживает ввод текста и изображений и создает выходное изображение SVG в нескольких соотношениях сторон,…

    Входные данные:
    • Текст
    • Изображения
    Исходящие данные:
    • Изображения
  • Логотип Recraft

    Recraft V4.1 Utility Pro

    Recraft
    Скопировано!

    Recraft V4.1 Utility Pro — это универсальная модель генерации изображений от Recraft. Она поддерживает текстовые и графические входные данные с выводом изображения в разрешении около 2K при различных соотношениях сторон — вдвое…

    Входные данные:
    • Текст
    • Изображения
    Исходящие данные:
    • Изображения
  • Логотип Recraft

    Recraft V4.1 Utility

    Recraft
    Скопировано!

    Recraft V4.1 Utility — это универсальная модель генерации изображений от Recraft. Она поддерживает текстовые и графические входные данные с выводом изображения в разрешении около 1K в различных соотношениях сторон, с типичным временем генерации…

    Входные данные:
    • Текст
    • Изображения
    Исходящие данные:
    • Изображения
  • Логотип Recraft

    Recraft V4.1 Pro

    Recraft
    Скопировано!

    Recraft V4.1 Pro — это модель генерации изображений от Recraft, настроенная для высокой эстетики. Она поддерживает текстовые и графические входные данные с выводом изображения в разрешении ~2K при различных соотношениях сторон…

    Входные данные:
    • Текст
    • Изображения
    Исходящие данные:
    • Изображения
  • Логотип Recraft

    Recraft V4.1

    Recraft
    Скопировано!

    Recraft V4.1 — это модель генерации изображений от Recraft, настроенная для создания изображений с высокой эстетической ценностью. Она поддерживает текстовые и графические входные данные с выходом изображения в разрешении около 1K в различных соотношениях сторон, с…

    Входные данные:
    • Текст
    • Изображения
    Исходящие данные:
    • Изображения
  • Логотип Recraft

    Recraft V4 Pro Vector

    Recraft
    Скопировано!

    Recraft V4 Pro Vector — это векторный (SVG) вариант Recraft V4 Pro. Он поддерживает ввод текста и изображений и создает векторный вывод изображения в различных соотношениях сторон на…

    Входные данные:
    • Текст
    • Изображения
    Исходящие данные:
    • Изображения
  • Логотип Recraft

    Recraft V4 Vector

    Recraft
    Скопировано!

    Recraft V4 Vector — это векторный (SVG) вариант Recraft V4. Он поддерживает ввод текста и изображений и создает векторный вывод изображения в различных соотношениях сторон. По сравнению с растровым…

    Входные данные:
    • Текст
    • Изображения
    Исходящие данные:
    • Изображения
  • Логотип Perceptron

    Perceptron Mk1

    Perceptron
    Скопировано!

    Perceptron Mk1 (Mark One) является высококачественной моделью Perceptron для работы с видео и воплощенного рассуждения в формате “зрение-язык”. Она принимает изображения и видеоматериалы в паре с запросами на естественном языке и выдает подробные ответы на визуальное понимание, как в структурированном, так и в естественном языке. Модель превосходно справляется с задачами понимания видео, такими как вопросы и ответы по видео, суммаризация и обнаружение событий. На входах с изображениями она продвигает привязку по примеру из мультимодальных подсказок, распознавание текста и разбор документов на сложных реальных данных, обнаружение и подсчет объектов с открытым словарем, а также оценку позы рук.

    Рассуждение может быть включено по запросу для обмена задержкой на более глубокий анализ сложных задач. Структурированные аннотации выдаются в тексте только при явном запросе через параметр annotation_format (передайте "point", "box" или "polygon" для пространственной локализации на изображениях, или "clip" (начало/конец временных меток) для временных сегментов в видео). Без annotation_format модель возвращает только текст на естественном языке.

    Входные данные:
    • Текст
    • Изображения
    • Видео
    Исходящие данные:
    • Текст
  • Логотип Recraft

    Recraft V4 Pro

    Recraft
    Скопировано!

    Recraft V4 Pro — это модель генерации изображений от Recraft. Она поддерживает текстовые и графические входные данные с выходом изображения в разрешении около 2K при различных соотношениях сторон, что вдвое больше разрешения…

    Входные данные:
    • Текст
    • Изображения
    Исходящие данные:
    • Изображения
  • Логотип Recraft

    Recraft V4

    Recraft
    Скопировано!

    Recraft V4 — это модель генерации изображений от Recraft. Она поддерживает текстовые и графические входные данные с выходом изображения разрешением около 1K в различных пропорциях. Она обеспечивает более сильное композиционное восприятие,…

    Входные данные:
    • Текст
    • Изображения
    Исходящие данные:
    • Изображения
  • Логотип Recraft

    Recraft V3

    Recraft
    Скопировано!

    Recraft V3 — это модель генерации изображений от Recraft. Она поддерживает текстовые и графические входные данные с выходным изображением в разрешении ~1K при различных соотношениях сторон. Поддерживает следующие параметры image_config:…

    Входные данные:
    • Текст
    • Изображения
    Исходящие данные:
    • Изображения