Загрузка...

Каталог AI моделей и нейросетей: сравнение и цены

Каталог нейросетей с описанием возможностей и ценами в рублях. Сравните стоимость токенов и выберите лучшее решение.

  • Логотип Google

    Veo 3.1 Lite

    Google
    Скопировано!

    Самая экономичная модель генерации видео от Google, разработанная для приложений с большим объемом и быстрой итерацией. Veo 3.1 Lite генерирует видео в разрешении 720p и 1080p из текстовых или графических подсказок с нативным синхронизированным звуком по цене менее 50% от стоимости Veo 3.1 Fast. Поддерживает клипы длительностью 4–8 секунд в ландшафтном (16:9) и портретном (9:16) форматах с водяными знаками SynthID. Идеально подходит для контентных платформ, создания коротких видео и автоматизированной генерации медиа.

    Входные данные:
    • Текст
    • Изображения
    Исходящие данные:
    • Видео
  • Логотип Tencent

    Hy3 preview

    Tencent
    Скопировано!

    Hy3 preview — это высокоэффективная модель Mixture-of-Experts от Tencent, предназначенная для агентных рабочих процессов и использования в производстве. Она поддерживает настраиваемые уровни рассуждений в режимах отключено, низкий и высокий, что позволяет балансировать между скоростью и глубиной в зависимости от задачи, обеспечивая при этом сильную генерацию кода и надежную производительность в многошаговых, реальных рабочих процессах.

    Входные данные:
    • Текст
    Исходящие данные:
    • Текст
  • Логотип Xiaomi

    MiMo-V2.5-Pro

    Xiaomi
    Скопировано!

    MiMo-V2.5-Pro — это флагманская модель Xiaomi, обеспечивающая высокую производительность в общих агентных возможностях, сложной программной инженерии и задачах с долгосрочным горизонтом, с лидирующими позициями в таких бенчмарках, как ClawEval, GDPVal и SWE-bench Pro.

    Входные данные:
    • Текст
    Исходящие данные:
    • Текст
  • Логотип Xiaomi

    MiMo-V2.5

    Xiaomi
    Скопировано!

    MiMo-V2.5 — это родная омнимодальная модель от Xiaomi. Она обеспечивает профессиональный уровень агентной производительности примерно за половину стоимости вывода, превосходя MiMo-V2-Omni в мультимодальном восприятии при выполнении задач по пониманию изображений и видео. Ее контекстное окно на 1M поддерживает полные документы, расширенные разговоры и сложные контексты задач за один проход, что делает ее идеальной для интеграции с агентными фреймворками, где важны сильные рассуждения, богатое восприятие и экономическая эффективность.

    Входные данные:
    • Текст
    • Аудио
    • Изображения
    • Видео
    Исходящие данные:
    • Текст
  • Логотип OpenAI

    GPT-5.4 Image 2

    OpenAI
    Скопировано!

    Image 2 объединяет модель GPT-5.4 от OpenAI с передовыми возможностями генерации изображений от GPT Image 2. Это позволяет создавать богатые мультимодальные рабочие процессы, позволяя пользователям без труда переходить от рассуждений и программирования к визуальной генерации в рамках одного взаимодействия.

    Входные данные:
    • Изображения
    • Текст
    • Файл
    Исходящие данные:
    • Изображения
    • Текст
  • Логотип Kwaivgi

    Kling: Video O1

    Kwaivgi
    Скопировано!

    Kling Video O1 — это модель генерации видео от Kuaishou. Она поддерживает ввод текста и изображений с выводом видео, позволяя создавать видео на основе текста и изображений. Модель подходит для производства кинематографического контента, обеспечивая контроль над первым и последним кадрами для точной композиции сцены. Она генерирует клипы длительностью 5 или 10 секунд в соотношениях сторон 16:9, 9:16 или 1:1.

    Входные данные:
    • Текст
    • Изображения
    Исходящие данные:
    • Видео
  • Логотип Minimax

    Hailuo 2.3

    Minimax
    Скопировано!

    Hailuo 2.3 — это модель генерации видео от MiniMax. Она принимает текстовые подсказки и эталонные изображения в качестве входных данных и генерирует видео на выходе, поддерживая как преобразование текста в видео, так и изображений в видео. Модель подходит для создания креативного контента, генерации кинематографических сцен и анимации персонажей, с акцентом на реалистичное движение и выразительное отображение персонажей.

    Входные данные:
    • Текст
    • Изображения
    Исходящие данные:
    • Видео
  • Логотип Moonshot AI

    Kimi K2.6

    Moonshot AI
    Скопировано!

    Kimi K2.6 — это модель следующего поколения от Moonshot AI, предназначенная для многозадачного кодирования, генерации UI/UX, управляемой кодом, и оркестрации множества агентов. Она справляется с комплексными задачами кодирования от начала до конца на языках Python, Rust и Go, и может преобразовывать подсказки и визуальные вводы в интерфейсы, готовые к производству. Ее архитектура роя агентов масштабируется до сотен параллельных субагентов для автономной декомпозиции задач — предоставляя документы, веб-сайты и электронные таблицы за один запуск без человеческого контроля.

    Входные данные:
    • Текст
    • Изображения
    Исходящие данные:
    • Текст
  • Логотип Mistral AI

    Voxtral Mini TTS

    Mistral AI
    Скопировано!

    Voxtral Mini TTS — это модель преобразования текста в речь от Mistral, которая поддерживает клонирование голоса без предварительного обучения и многоязычную поддержку. Она преобразует текстовый ввод в аудиовыход с естественным звучанием.

    Входные данные:
    • Текст
    Исходящие данные:
    • Речь
  • Логотип Google

    Gemini Embedding 2 Preview

    Google
    Скопировано!

    Gemini Embedding 2 Preview — это первая мультимодальная модель встраивания от Google. В настоящее время мы поддерживаем отображение текста и изображений в единое векторное пространство для семантического поиска и генерации с дополнением извлечением (RAG). Она поддерживает контекст ввода до 8,192 токенов и гибкие размеры выходных данных от 128 до 3,072 (рекомендуемые: 768, 1536 или 3,072). Модель разработана для кросс-модальной схожести — вы можете встроить текстовый запрос и получить наиболее релевантные изображения или наоборот — что делает её хорошо подходящей для мультимодального поиска, рекомендаций и конвейеров понимания документов.

    Входные данные:
    • Текст
    • Изображения
    • Файл
    • Аудио
    • Видео
    Исходящие данные:
    • Embeddings
  • Логотип Anthropic

    Claude Opus 4.7

    Anthropic
    Скопировано!

    Opus 4.7 — это следующее поколение семейства Opus от Anthropic, созданное для долгосрочных асинхронных агентов. Основываясь на кодировочных и агентных возможностях Opus 4.6, оно обеспечивает более высокую производительность при выполнении сложных многоэтапных задач и более надежное выполнение агентных операций в рамках расширенных рабочих процессов. Особенно эффективно для асинхронных агентных конвейеров, где задачи разворачиваются со временем — большие кодовые базы, многоэтапная отладка и комплексная организация проектов.

    Помимо кодирования, Opus 4.7 предлагает улучшенные возможности для интеллектуальной работы — от составления документов и создания презентаций до анализа данных. Оно сохраняет согласованность в очень длинных выводах и расширенных сессиях, что делает его отличным выбором для задач, требующих настойчивости, суждения и доведения до конца.

    Входные данные:
    • Текст
    • Изображения
    • Файл
    Исходящие данные:
    • Текст
  • Логотип ByteDance

    Seedance 2.0 Fast

    ByteDance
    Скопировано!

    Seedance 2.0 Fast — это модель генерации видео от ByteDance. Она поддерживает текст-видео, изображение-видео с контролем первого и последнего кадра, а также мультимодальное преобразование ссылок в видео. Модель отдает приоритет скорости генерации и снижению затрат по сравнению с максимальным качеством вывода. Количество токенов определяется по формуле (высота выходного видео * ширина выходного видео * длительность * 24) / 1024.

    Входные данные:
    • Текст
    • Изображения
    • Видео
    • Аудио
    Исходящие данные:
    • Видео
  • Логотип ByteDance

    Seedance 2.0

    ByteDance
    Скопировано!

    Seedance 2.0 — это модель генерации видео от ByteDance. Она поддерживает преобразование текста в видео, изображения в видео с контролем первого и последнего кадра, а также мультимодальное преобразование ссылки в видео. Модель особенно хорошо сохраняет согласованность персонажей, визуальный стиль и движение камеры из исходного материала. Количество токенов определяется по формуле (высота выходного видео * ширина выходного видео * продолжительность * 24) / 1024.

    Входные данные:
    • Текст
    • Изображения
    • Видео
    • Аудио
    Исходящие данные:
    • Видео
  • Логотип Alibaba

    Wan 2.7

    Alibaba
    Скопировано!

    Wan 2.7 — это модель генерации видео от Alibaba. Она поддерживает преобразование текста в видео, изображений в видео с контролем первого и последнего кадра, а также преобразование с использованием эталонных изображений, где несколько эталонных изображений определяют стиль и содержание создаваемой сцены.

    Входные данные:
    • Текст
    • Изображения
    Исходящие данные:
    • Видео
  • Логотип Z AI

    GLM 5.1

    Z AI
    Скопировано!

    GLM-5.1 — это флагманская открытая модель от Z.ai, разработанная для проектирования сложных систем и долгосрочных рабочих процессов агентов. Созданная для опытных разработчиков, она обеспечивает производительность промышленного уровня при выполнении крупномасштабных программных задач, соперничая с ведущими закрытыми моделями. Благодаря продвинутому агентному планированию, глубокому бэкенд-рассуждению и итеративной самокоррекции, GLM-5.1 выходит за рамки генерации кода к полноценному созданию систем и автономному выполнению.

    Входные данные:
    • Текст
    Исходящие данные:
    • Текст