Загрузка...

Каталог AI моделей и нейросетей: сравнение и цены

Каталог нейросетей с описанием возможностей и ценами в рублях. Сравните стоимость токенов и выберите лучшее решение.

  • Логотип NVIDIA

    Nemotron 3 Ultra

    NVIDIA
    Скопировано!

    NVIDIA Nemotron 3 Ultra — это модель открытого разума и оркестрации от NVIDIA, с 55 миллиардами активных параметров из 550 миллиардов общих (MoE). Построенная на гибридной архитектуре Transformer-Mamba с смесью экспертов, она поддерживает ввод и вывод текста с контекстным окном до 1 миллиона токенов. Она подходит для длительных агентных рабочих процессов, включая оркестрацию агентов, кодирование агентов, глубокие исследования и сложные корпоративные задачи.

    Она особенно сильна в многошаговом рассуждении и планировании, с высокопроизводительным выводом, предназначенным для высокообъемных агентных конвейеров. Это часть семейства открытых моделей NVIDIA Nemotron для агентного ИИ.

    Входные данные:
    • Текст
    Исходящие данные:
    • Текст
  • Логотип Qwen

    Qwen3.7 Plus

    Qwen
    Скопировано!

    Qwen3.7-Plus — это экономичная модель в серии Qwen3.7 от Alibaba. Она поддерживает ввод текста и изображений с выводом текста, развивая текстовые возможности серии с комплексным обновлением её способностей в области зрения и языка, при этом сохраняя полнофункциональный интеллект агентского уровня для кодирования, использования инструментов и рабочих процессов продуктивности. Её отличительная черта — способность мультимодального интерактивного гибридного агента: она может воспринимать сцены реального мира, читать экраны и взаимодействовать с графическими интерфейсами, генерировать код из визуальных ссылок и выполнять навигацию от начала до конца в мобильных приложениях.

    Входные данные:
    • Текст
    • Изображения
    Исходящие данные:
    • Текст
  • Логотип Microsoft

    MAI-Voice-2

    Microsoft
    Скопировано!

    MAI-Voice-2 — это высококачественная, выразительная модель синтеза речи от Microsoft, работающая на базе Azure AI Speech. Она синтезирует естественно звучащую речь на более чем 10 языках с поддержкой выразительных стилей SSML (радостный, грустный, взволнованный и т.д.) и контролем скорости (0.5×–2×). Имена голосов следуют формату локали Azure (например, en-US-Harper:MAI-Voice-2). Выходные данные доступны в форматах MP3 и PCM с частотой 24 кГц.

    Входные данные:
    • Текст
    Исходящие данные:
    • Речь
  • Логотип Microsoft

    MAI-Transcribe 1.5

    Microsoft
    Скопировано!

    MAI-Transcribe 1.5 — это модель быстрой транскрипции от Microsoft на базе Azure AI Speech. Она поддерживает более 100 локалей BCP-47 с автоматическим определением языка, автоматической пунктуацией и поминутной тарификацией на основе продолжительности. Использует API быстрой транскрипции Azure Speech (v2025-10-15).

    Входные данные:
    • Аудио
    Исходящие данные:
    • Транскрибация
  • Логотип Microsoft

    MAI-Image-2.5

    Microsoft
    Скопировано!

    MAI-Image-2.5 от Microsoft — это высококачественная модель генерации изображений, доступная через Azure AI Foundry. Она создает фотореалистичные и художественные изображения на основе текстовых подсказок с поддержкой различных соотношений сторон.

    Входные данные:
    • Текст
    • Изображения
    Исходящие данные:
    • Изображения
  • Логотип Minimax

    MiniMax M3

    Minimax
    Скопировано!

    MiniMax-M3 — это мультимодальная базовая модель от MiniMax. Она поддерживает текстовые, графические и видео входные данные с текстовым выводом, имеет контекстное окно на 1 миллион токенов и подходит для работы на длительных горизонтах, программирования и использования инструментов. Модель построена на MiniMax Sparse Attention (MSA), который заменяет полное внимание выбором блоков KV, чтобы снизить вычислительные затраты на токен при длинном контексте — примерно в 20 раз дешевле предыдущего поколения при 1 миллионе токенов, с существенно более быстрым заполнением и декодированием, сохраняя качество выполнения большинства задач.

    Обученная как нативная мультимодальная модель на перемешанных данных и настроенная для многократного, производственного взаимодействия через интерактивную пользовательскую симуляцию, модель ориентирована на устойчивые, многошаговые задачи, а не на выполнение в один шаг.

    Входные данные:
    • Текст
    • Изображения
    • Видео
    Исходящие данные:
    • Текст
  • Логотип Stepfun

    Step 3.7 Flash

    Stepfun
    Скопировано!

    Шаг 3.7 Flash — это новейшая высокоэффективная мультимодальная модель Mixture-of-Experts от StepFun. Она сочетает языковую основу с 196 миллиардами параметров и визуальный энкодер для естественного понимания изображений и видео, активируя примерно 11 миллиардов параметров на токен. Модель поддерживает контекстное окно размером 256 тысяч и предоставляет возможность выбора уровней рассуждения (высокий/средний/низкий), позволяя пользователям балансировать между скоростью, стоимостью и глубиной рассуждений.

    Разработана для кодирования, агентных рабочих процессов, структурированных выводов и задач с длинным контекстом для повышения производительности.

    Входные данные:
    • Текст
    • Изображения
    • Видео
    Исходящие данные:
    • Текст
  • Логотип Anthropic

    Claude Opus 4.8

    Anthropic
    Скопировано!

    Claude Opus 4.8 — это самая мощная модель из семейства Opus, доступная от компании Anthropic. Она поддерживает ввод текста, изображений и файлов с текстовым выводом, обладает возможностями для рассуждений и контекстным окном в 1 миллион токенов. Модель подходит для высокоавтономных агентов, долгосрочных агентных задач, работы с информацией и задач, основанных на памяти, где важна согласованность в течение длительных сессий.

    Она особенно сильна в многошаговых рассуждениях, сложном кодировании и комплексной организации проектов — больших кодовых базах, многоэтапной отладке и длительных асинхронных агентных процессах. Помимо кодирования, она справляется с информационной работой, такой как составление документов, создание презентаций и анализ данных, поддерживая качество на протяжении очень длинных выводов.

    Входные данные:
    • Текст
    • Изображения
    • Файл
    Исходящие данные:
    • Текст
  • Логотип NVIDIA

    Parakeet TDT 0.6B v3

    NVIDIA
    Скопировано!

    Parakeet TDT 0.6B v3 — это многоязычная модель преобразования речи в текст от NVIDIA с 600 миллионами параметров, построенная на архитектуре FastConformer-TDT. Обученная на наборе данных Granary (более 670,000 часов аудио), она поддерживает автоматическое определение языка для всех официальных языков ЕС и достигает среднего уровня ошибок в словах 6.34% на доске лидеров HuggingFace Open ASR. Возвращает транскрибированный текст с пунктуацией и временными метками сегментов.

    Входные данные:
    • Аудио
    Исходящие данные:
    • Транскрибация
  • Логотип Qwen

    Qwen3.7 Max

    Qwen
    Скопировано!

    Qwen3.7-Max является флагманской моделью в серии Qwen3.7 от Alibaba. Она поддерживает ввод и вывод текста и предназначена для задач, ориентированных на агентов, с особыми преимуществами в области программирования, офисных и производительных задач, а также в долгосрочном автономном выполнении. Модель демонстрирует заметные улучшения в программировании и агентной производительности по сравнению с предыдущими поколениями Qwen и поддерживает явное кэширование подсказок для эффективного повторного использования контекста.

    Входные данные:
    • Текст
    Исходящие данные:
    • Текст
  • Логотип SpaceXAI

    Grok Build 0.1

    SpaceXAI
    Скопировано!

    Grok Build 0.1 — это быстрый модель кодирования от xAI, специально обученная для агентных рабочих процессов в области программной инженерии. Она поддерживает текстовые и графические входные данные с текстовым выводом и оптимизирована для интерактивных агентов кодирования, использования инструментов и многоэтапных задач разработки. Модель обеспечивает работу Grok Build CLI от xAI и имеет контекстное окно на 256K без ограничения на текстовый вывод, что делает её подходящей для длительных процессов кодирования и автоматизации. В настоящее время доступна в раннем доступе.

    Входные данные:
    • Текст
    • Изображения
    • Файл
    Исходящие данные:
    • Текст
  • Логотип Google

    Gemini Embedding 2

    Google
    Скопировано!

    Gemini Embedding 2 — это первая мультимодальная модель встраивания от Google. В настоящее время мы поддерживаем отображение текста и изображений в единое векторное пространство для семантического поиска и генерации с дополнением извлечением (RAG). Модель поддерживает контекст ввода до 8,192 токенов и гибкие размеры выходных данных от 128 до 3,072 (рекомендуемые: 768, 1536 или 3,072). Разработана для кросс-модальной схожести — вы можете встроить текстовый запрос и получить наиболее релевантные изображения или наоборот — что делает её хорошо подходящей для мультимодального поиска, рекомендаций и процессов понимания документов.

    Входные данные:
    • Текст
    • Изображения
    • Файл
    • Аудио
    • Видео
    Исходящие данные:
    • Embeddings
  • Логотип Google

    Gemini 3.5 Flash

    Google
    Скопировано!

    Gemini 3.5 Flash — это высокоэффективная мультимодальная модель от Google, обеспечивающая кодирование и рассуждение почти на профессиональном уровне при стоимости и скорости уровня Flash. Она высоко оптимизирована для повышения квалификации в кодировании и параллельного выполнения агентных циклов, поддерживая текстовые, графические, видео, аудио и PDF-входные данные.

    По умолчанию использует средний уровень усилий для более быстрых и экономичных ответов, с полной поддержкой уровней мышления (минимальный, низкий, средний, высокий) для тонкой настройки соотношения затрат и производительности.

    Входные данные:
    • Текст
    • Изображения
    • Видео
    • Файл
    • Аудио
    Исходящие данные:
    • Текст
  • Логотип SpaceXAI

    Grok Imagine Video

    SpaceXAI
    Скопировано!

    Grok Imagine Video — это быстрый модель генерации видео от xAI, основанная на тексте, изображениях и ссылках. Она создаёт короткие видео (1–15 секунд, 24 кадра в секунду) с разрешением 480p или 720p в семи соотношениях сторон — 1:1, 16:9, 9:16, 4:3, 3:4, 3:2 и 2:3.

    Модель поддерживает три режима генерации: текст-видео на основе одного текстового запроса, изображение-видео, которое анимирует неподвижное изображение, и ссылка-видео, где вывод основывается на до семи ссылочных изображениях для создания последовательных персонажей, стилей или настроек.

    Входные данные:
    • Текст
    • Изображения
    Исходящие данные:
    • Видео
  • Логотип SpaceXAI

    Grok Imagine Image Quality

    SpaceXAI
    Скопировано!

    Grok Imagine Image Quality — это модель быстрого и высокоточного генерации и редактирования изображений от xAI. Она принимает текстовые подсказки и необязательные эталонные изображения, создавая фотореалистичные результаты с разрешением 1K или 2K на…

    Входные данные:
    • Текст
    • Изображения
    Исходящие данные:
    • Изображения