🚀 Open-Source и платные ИИ-модели

Календарь релизов 2025–2026

Отслеживайте последние релизы ИИ-моделей: от бесплатных open-source до платных облачных решений.

295
Дней отслеживается
162
Дней релизов
924
Моделей
–
Сентябрь
2026
📅 24.09
6 моделей
FLUX 3 Action
открытая world-action модель (WAM — world action model) на 7B параметров от Black Forest Labs: по кадрам камер, состоянию робота и текстовой инструкции выдаёт моторные команды и предсказание будущих кадров…
ИзображенияOpen-Source (локально)
FLUX 3 Action DROID
вариант FLUX 3 Action от Black Forest Labs, дообученный на датасете DROID под манипуляции реальными роботами; те же 7B параметров, BF16-чекпоинт DiT, лицензия FLUX Kommunity License v1.0, нативная интеграция с LeRobot и edge-развёртывание н…
ИзображенияOpen-Source (локально)
LFM2.5-VL-3B-DSpark
черновая (draft) модель на 279,5M параметров от Liquid AI для speculative decoding: ускоряет VLM (vision-language model) LFM2.5-VL-3B без изменения ответов — до 3,13× на устройстве и 2,66× на H100 при +8,9% памяти…
МультимодальныеOpen-Source (локально)
Rufus-Air
открытый воспроизводимый рецепт пост-тренинга от Amazon поверх GLM-4.5-Air-Base (MoE-архитектура (Mixture of Experts), 106B параметров, 12B активных): восемь стадий от SFT и RL на ризонинг/код до агентных стадий и RLHF, на открытых данных…
ТекстOpen-Source (локально)
InternW0
фундаментальная физическая world-модель от Shanghai AI Laboratory: асимметричная архитектура «видео-эксперт + лёгкий action-эксперт» на flow matching, обучена на ~7200 часах робо- и эгоцентрического видео…
ВидеоOpen-Source (локально)
BanglaTurn
бенчмарк и модель детекции конца реплики (end-of-turn) для бенгальской речи: энкодер Whisper плюс задачные классификационные головы, 84,33% точности на разговорной речи; корпус и модель опубликованы вместе со статьёй (https://arxiv.org/abs/…
АудиоOpen-Source (локально)
📅 23.09
7 моделей
Gemini 3.8 Flash TTS
закрытая text-to-speech-модель Google DeepMind с генеративным дизайном голоса: новый голос создаётся из текстового описания, есть построчная «режиссура» (акцент, темп, смена диалекта), 2000+ готовых голосов и 100+ языков…
АудиоПлатные (облако)
Gemini 3.8 Flash-Lite TTS
облегчённая версия TTS-модели Google для высоконагруженных сценариев: дубляж, озвучка контента и голосовые агенты с тонкой настройкой тона…
АудиоПлатные (облако)
Qwen-Audio-3.1
обновлённый аудио-стек из пяти закрытых моделей от команды Qwen (Alibaba): ASR, ASR-Next, TTS, TTS-Next и Realtime. TTS-Next комбинирует языковую модель с диффузией и генерирует речь, звуковые эффекты и фон за один проход; Alibaba одновреме…
АудиоПлатные (облако)
FLUX 3 Action
открытая world-action модель (WAM) на 7B параметров от Black Forest Labs: принимает кадры с камеры, состояние робота и текстовую инструкцию, а затем одновременно предсказывает 32 действия и будущие видеокадры…
ВидеоOpen-Source (локально)
FLUX 3 Action Droid
специализированный чекпойнт того же семейства от Black Forest Labs, дообученный под платформу DROID и готовый к запуску как политика управления без дополнительной адаптации головы действий…
ИзображенияOpen-Source (локально)
Nemotron 3 Diarization
компактная open-weight модель NVIDIA на 100M параметров: 31-слойный трансформер-энкодер с RoPE, работающий по мел-спектрограммам и выдающий вероятности активности до 8 говорящих с разрешением 10 мс…
АудиоOpen-Source (локально)
Ovis-Omni-Embedding-3B
универсальная омни-модальная embedding-модель на 3B параметров от команды ATH-MaaS на базе Qwen2.5-Omni-3B: один общий трансформер-бэкбон кодирует текст, изображения, документы, видео и аудио в единое пространство для any-to-any поиска и RA…
ВидеоOpen-Source (локально)
📅 22.09
8 моделей
Claude Opus 5.5
флагманская закрытая модель Anthropic, первая в волне 5.5: по большинству рабочих задач держит уровень Fable 5.1, но обходится на 40% дешевле Opus 5 ($4/$20 за 1M токенов) и выдаёт токены на 30% быстрее…
ТекстПлатные (облако)
GPT-6 Sol
закрытая модель OpenAI среднего тира под регулярный кодинг и агентские задачи, ценой $2/$10 за 1M токенов (вдвое дешевле GPT-5.6)…
ТекстПлатные (облако)
GPT-6 Luna
младшая и самая дешёвая модель линейки GPT-6 от OpenAI, заточенная под массовые рутинные операции: извлечение данных, суммаризацию и клерикальный поток…
ТекстПлатные (облако)
MiMo-V2.6-Pro
флагманская омнимодальная reasoning-модель Xiaomi на триллион параметров с MoE-архитектурой (Mixture of Experts, «смесь экспертов»), нативно принимает текст, изображения, видео и аудио при контексте 1M токенов…
ВидеоOpen-Source (локально)
MiMo-V2.6-Flash
облегчённая омнимодальная модель Xiaomi на 159B параметров с тем же контекстом 1M токенов и полным набором модальностей, рассчитанная на высокочастотные вызовы и массовые задачи…
ТекстOpen-Source (локально)
MiMo-V2.6-Distill-Qwen-9B
компактная дистиллированная версия MiMo-V2.6 на базе Qwen на 9B параметров, выпущенная Xiaomi вместе со старшими моделями и RL-стеком (7000+ сред обучения с подкреплением)…
ВидеоOpen-Source (локально)
MiMo-V2.6-Pro-UltraSpeed
скоростной вариант флагмана Xiaomi: то же качество, что у Pro, но до 20 раз быстрее генерация, под real-time и чувствительные к задержке сценарии…
ТекстПлатные (облако)
WorldCrafter
видео-world-model от ARC Lab (Tencent) с неявной 3D-осознанной памятью, запрашиваемой по положению камеры; генерирует согласованное исследование сцены из картинки или текста (image-to-video и text-to-video) с управлением траекторией камеры…
ВидеоOpen-Source (локально)
📅 16.09
2 модели
GLiFormer (base-v1 / large-v1)
схема-обусловленный энкодер от украинской команды Knowledgator Engineering на базе DeBERTa, две версии: 264M и 575M параметров…
ТекстOpen-Source (локально)
LimiX-2
табличная foundation-модель на 400M параметров от StableAI (архитектура Contextual Mechanism Network с предобучением Context-Conditional Masked Modeling на синтетике из структурных причинных моделей)…
ТекстOpen-Source (локально)
📅 15.09
4 модели
Gemini 3.8 Live
закрытая speech-to-speech (аудио-в-аудио) модель Google DeepMind для голосовых агентов: ведёт диалог почти в реальном времени, сама определяет и переключает 97 языков посреди разговора и вызывает инструменты в фоне, не прерывая речь…
АудиоПлатные (облако)
Gemini 3.8 Live Extended Thinking
вариант той же аудиомодели Google DeepMind с фоновым рассуждением прямо во время живого разговора, для многошаговых голосовых задач…
АудиоПлатные (облако)
Koa
первая собственная reasoning-модель Salesforce, сделанная вместе с NVIDIA: дообучение (SFT + RL с GRPO) поверх открытой NVIDIA Nemotron 3 Super на 120B параметров, гибридная Mamba-attention MoE-архитектура (Mixture of Experts)…
ТекстПлатные (облако)
Cartesian
генеративная 3D-модель стартапа Formas для архитектуры и промышленного дизайна: строит геометрию по тексту, скетчу или готовой модели…
ТекстПлатные (облако)
📅 11.09
2 модели
Fugu Max
от японской Sakana AI: не монолитная модель, а обученный мульти-агентный оркестратор (роутер, распределяющий задачу по пулу открытых и специализированных моделей за одним API), контекст 1M токенов, поддержка изображений и вызова инструменто…
ИзображенияПлатные (облако)
Fugu Ultra v2.0
флагманская конфигурация того же оркестратора Sakana AI, настроенная не на цену, а на максимум качества в сложных многошаговых рассуждениях, программировании и разборе графиков; контекст 1M токенов, vision и структурированный JSON-вывод…
МультимодальныеПлатные (облако)
📅 10.09
5 моделей
DeepSeek-V4.1-Flash
открытая мультимодальная MoE-модель (Mixture of Experts — «смесь экспертов») от DeepSeek: 552B параметров при всего 8B активных на префилле и 16B на декоде, архитектура Causal Encoder-Decoder из 40 слоёв и контекст 1M токенов с нативным пон…
МультимодальныеOpen-Source (локально)
North-Small-Translate-1.0
специализированная переводческая MoE-модель от Cohere Labs (совместно с RWS/Language Weaver): 218B总 параметров, 25B активных, окно 16K вход / 16K выход, 50+ языков и локалей…
ТекстOpen-Source (локально)
SWE-2
закрытая агентная модель для кодинга от Cognition, дообученная поверх открытой Kimi K3 от Moonshot (2.8T параметров, ~104B активных) единым RL-прогоном сразу для уровней medium/high/max…
ТекстПлатные (облако)
GPT-Live-1
закрытая полнодуплексная речевая модель OpenAI, которая слушает и говорит одновременно, обрабатывает перебивания и вызывает инструменты в реальном времени, заменяя связку STT → LLM → TTS одной сетью…
АудиоПлатные (облако)
Gen-1 Slides
первая собственная модель Genspark, заточенная под генерацию готовых презентаций по одному запросу; построена на открытой базе MiniMax M3 и дообучена через RL прямо в продакшене AI Slides с циклом планирование → генерация страниц → рендер →…
ТекстПлатные (облако)
📅 09.09
8 моделей
Gander (Omni Interaction Agent)
открытая omni-модель на 9B параметров от Tencent Hunyuan Speech Team совместно с ZJU, SJTU, CUHK и NTU: потоковая обработка видео, речи и текста в схеме Thinker-Talker с полнодуплексным диалогом и перебиваниями; веса, код и данные под Apach…
ВидеоOpen-Source (локально)
NeoHorse-1 (4B / 9B)
агентные dense-модели команды TokenRhythm на базе Qwen3.5 с контекстом 262K токенов (расширяем до ~1M), заточенные под работу с инструментами, кодинг и следование инструкциям…
ТекстOpen-Source (локально)
Granite TimeSeries PatchTST-FM-r2
фундаментальная модель временных рядов от IBM Research на ~385M параметров с Conformer-блоками и контекстом 8192 шага; делает zero-shot прогноз с 99 квантилями и импутацию пропусков без дообучения…
ТекстOpen-Source (локально)
Marigold V2
Diffusion-Transformer (диффузионный трансформер) от HUAWEI Bayer Lab, EPFL и Университета Болоньи для монокулярной оценки глубины, нормалей и альбедо: 4-битная квантизация плюс QLoRA rank-128 поверх Qwen-Image-Edit-2509 и вывод за один шаг…
ИзображенияOpen-Source (локально)
OpenWAM-α
открытая world-action модель (мир + действие) от консорциума китайских лабораторий, обученная на ~6400 часах эгоцентрического видео людей и роботов (518.5M кадров); покрывает одноруких, двуруких роботов и ловкие кисти, лидирует на 8 симуляц…
ВидеоOpen-Source (локально)
GE-Act 2.0
world-action модель для роботизированной манипуляции от AgiBot Research: контроль-ориентированный автоэнкодер, одношаговый визуальный планировщик и модель обратной динамики…
ТекстOpen-Source (локально)
Suno v6 / v6-wild
закрытые генеративные музыкальные модели Suno, разработанные совместно с Warner Music Group, BMG и Believe: мультимодальный вход (текст, аудио, изображения, видео) и правка отдельных частей трека обычным текстом без перегенерации…
ВидеоПлатные (облако)
Suno v6-mini
облегчённая и быстрая версия шестого поколения Suno, открытая всем пользователям, включая бесплатный тариф; сохраняет мультимодальный ввод и покомпонентное редактирование песни, но веса не публикуются — доступ только через облако (https://s…
МультимодальныеБесплатные (облако)
📅 08.09
7 моделей
Nex-N2.5-Max
флагман нового семейства агентных моделей от Nex-AGI: текстовая MoE-архитектура (Mixture of Experts — «смесь экспертов») на 1.6 трлн параметров с контекстом 262K токенов, заточенная под сложный reasoning, кодинг и длинные агентные сценарии…
ТекстOpen-Source (локально)
Nex-N2.5-Pro
мультимодальная VLM (vision-language model — модель «зрение + язык») на 397B параметров от Nex-AGI для computer use: умеет управлять браузером и десктопом, запускать код и проверять результат по визуальной обратной связи…
МультимодальныеOpen-Source (локально)
Nex-N2.5-mini
компактная мультимодальная MoE-модель на 35B параметров от Nex-AGI, построенная на базе Qwen3.5, с контекстом 262K и переключаемыми режимами «думания»…
МультимодальныеOpen-Source (локально)
Mercury 2.5
крупнейшая на сегодня диффузионная языковая модель (dLLM — генерирует токены параллельно, уточняя черновик, а не слева направо) от Inception Labs, с контекстом 260K токенов…
ТекстПлатные (облако)
GPT-Image-2.5 Flare
закрытая генеративная image-модель OpenAI, дефолтный вариант для массовых сценариев: соцконтент, продуктовые изображения, визуальный поиск, быстрое прототипирование…
ИзображенияПлатные (облако)
GPT-Image-2.5 Sunburst
премиальная версия той же линейки OpenAI, рассчитанная на продакшн-креатив и многораундовое точное редактирование с сохранением персонажей и объектов с референсных фото…
ИзображенияПлатные (облако)
Muse
персональный AI-агент Meta на одноимённом семействе моделей Muse: не просто отвечает, а выполняет задачи — покупки, бронирование билетов, запись на приём, заполнение форм…
ТекстБесплатные (облако)
📅 07.09
7 моделей
MiniCPM5-2B
плотная (dense) LLM на 2,52B параметров от OpenBMB: 42 слоя, GQA (grouped-query attention), нативный контекст 131K токенов, лицензия Apache 2.0…
ТекстOpen-Source (локально)
Qwen-Drive 1.0
vision-language модель (VLM, «зрение + язык») на 4B от команды Alibaba Qwen и Хуачжунского университета науки и технологий для автономного вождения: BEV-голова (bird's-eye view, вид сверху) для 3D-детекции, VQA по дорожной сцене и diffusion…
МультимодальныеOpen-Source (локально)
OxCoder-9B
компактная кодинг-модель на 9B от OrionLLM на базе Qwen3.5-9B, дистиллированная из агентских трейсов Fable 5.1 и GLM-5.3 в Claude Code, OpenCode и Codex…
ТекстOpen-Source (локально)
MiniCPM5-2B-GPTQ
официальная 4-битная квантованная сборка MiniCPM5-2B от OpenBMB, выложенная на следующий день после базовой модели; тот же контекст 131K и лицензия Apache 2.0, но заметно меньше требования к памяти для edge-устройств и потребительских GPU (…
ТекстOpen-Source (локально)
JustRL-II-base-model
стартовый RL-чекпоинт от OpenBMB/THUNLP на архитектуре LlamaForCausalLM с длинными цепочками рассуждений (long-CoT); даёт 61% на AIME 2025 до обучения с подкреплением и 81% после рецепта JustRL II за ~300 шагов…
ТекстOpen-Source (локально)
amx-reasoning-v1-instruct
исследовательская causal-LM на 7,49M параметров (3,3M активных на токен) с чередованием chunked sliding-window attention и linear attention с лог-затуханием…
ТекстOpen-Source (локально)
SupraNeo-4M
крошечная decoder-only модель на 4,07M параметров от SupraLabs (архитектура Qwen3, 12 слоёв, hidden 160, контекст 1024), обученная с нуля на одной A100…
ТекстOpen-Source (локально)
📅 04.09
11 моделей
LLaDA-Image
открытая модель генерации и редактирования изображений от inclusionAI (команда Ant Group): 6B Diffusion Transformer, обученный с нуля, в связке с замороженным блоком понимания на базе диффузионной языковой модели LLaDA2.0-Mini…
ИзображенияOpen-Source (локально)
LLaDA-Image-Turbo
дистиллированная быстрая версия LLaDA-Image от inclusionAI, генерирующая изображение за 2–4 шага сэмплирования вместо 50 при сопоставимом качестве…
ИзображенияOpen-Source (локально)
Puffin-World
унифицированная мультимодальная модель мира от S-Lab NTU, Мичиганского университета и ACE Robotics: связка энкодера C-RADIO, LLM Qwen и диффузионного трансформера (8.1B в версии Pro) с представлением Omni-Camera…
МультимодальныеOpen-Source (локально)
Jina-OCR-v1
OCR-модель сквозного разбора документов от Jina AI: MoE-архитектура (Mixture of Experts — смесь экспертов) на 3B параметров с ~570M активных на токен, наследует сжимающий визуальный энкодер DeepSeek-OCR и спекулятивное декодирование FastMTP…
МультимодальныеOpen-Source (локально)
mnma_qwen3.8_27b_nvfp4
27B гибридная LLM от Minima AI (16 слоёв softmax-внимания + 48 слоёв линейного Gated DeltaNet), полностью квантованная в NVFP4 W4A4 по всем 496 линейным слоям…
ТекстOpen-Source (локально)
Wayu-Paxa-TTS-Edge
компактная тайская TTS-модель (text-to-speech — синтез речи) на 82M параметров от команды Kunat Pipatanakul, обученная целиком на синтетической речи от крупной модели-учителя клонирования голоса…
АудиоOpen-Source (локально)
WorldReward
reward-модель на базе VLM (vision-language model — модель «зрение + язык») для попарного сравнения видео от моделей мира с управлением камерой…
ВидеоOpen-Source (локально)
FlashRender
генеративный рендерер от EverEx и соавторов, пересобирающий исходное видео вдоль заданной траектории камеры за секунды. Строится на camera-controlled video MeanFlow с on-policy дистилляцией потоковых карт, что даёт в 25 раз меньшую стоимост…
ВидеоOpen-Source (локально)
LatentPress
система сжатия контекста от Zhengze Zhou и Hejian Sang: лёгкие адаптеры на 4.2M–26.2M параметров (~0.1% от размера декодера) превращают диалоги и длинные документы в непрерывные memory-токены поверх замороженной LLM…
ТекстOpen-Source (локально)
RoboTok
движок поиска демонстраций интернет-масштаба от Rice RobotPI Lab для обучения ловкой манипуляции роботов. Строит латентное пространство движений по 3D-траекториям кистей рук в акторо-центричных системах координат и по видео-запросу находит…
ВидеоOpen-Source (локально)
Project HydraFusion
закрытый оркестратор моделей от GitHub, вышедший в research preview в GitHub Copilot CLI: строит план выполнения из моделей разных провайдеров по схемам Single, Cascade и Critique. На TerminalBench 2.1 даёт +4.9 п.п…
ТекстПлатные (облако)
📅 03.09
9 моделей
GPT-6 Astra
флагманская закрытая модель OpenAI, доступная только через API (метка gpt-6-astra, $10/$50 за 1M токенов) и в ChatGPT Plus/Pro/Business/Enterprise; усилена в кодинге, ресёрче и управлении компьютером…
ТекстПлатные (облако)
K2 Horizon
семейство из шести полностью открытых моделей от Institute of Foundation Models (MBZUAI): от 0.9B до 375B-A23B, dense и MoE-архитектура (Mixture of Experts), а вариант 36B-A4B добавляет Mixture-of-Value Attention…
ТекстOpen-Source (локально)
MAI-Transcribe-2
закрытая модель распознавания речи от Microsoft AI, доступ только через облачный API по цене $0.10 за час аудио. Поддерживает 60 языков с автоопределением, диаризацию говорящих, пословные таймстемпы и hotwords; первое место на FLEURS со сре…
АудиоПлатные (облако)
NeoMME
мультимодальный энкодер от H Company на 260M и 800M параметров: единый двунаправленный трансформер обрабатывает текст и сырые патчи изображений 32×32, контекст 16 384 токена, словарь на 131k…
МультимодальныеOpen-Source (локально)
VibeVoice-ASR-Streaming
потоковые ASR-модели (автоматическое распознавание речи) от Microsoft Research на 1.5B и 7B параметров: транскрибируют и одновременно определяют говорящего прямо во время поступления аудио…
АудиоOpen-Source (локально)
Jina-OCR-v1
документ-парсер от Jina AI: MoE-декодер на 3B (~570M активных параметров) поверх сжимающего визуального энкодера DeepSeek-OCR плюс спекулятивное декодирование FastMTP…
МультимодальныеOpen-Source (локально)
SolarWM
открытый стек видео-world-моделей (модели мира) от CUHK-Shenzhen и партнёров: четыре модели на 5B–33B, построенные на Wan2.2, LTX-2.5 и MiniMax-H3, обучены на 1.43M клипов из 10 датасетов…
ВидеоOpen-Source (локально)
WeatherNext 3
погодная модель Google DeepMind и Google Research на архитектуре Functional Generative Network (mesh-трансформер), обновляет прогноз ежечасно по живым спутниковым снимкам с разрешением 5–25 км…
ТекстПлатные (облако)
Wayu-Paxa-TTS-Edge
компактная TTS-модель (text-to-speech) на 82M параметров для тайского языка, дистиллированная из большой voice-cloning модели-учителя и работающая на устройстве без референсного аудио…
АудиоOpen-Source (локально)
📅 02.09
9 моделей
Gemini 3.8 Flash
закрытая быстрая reasoning-модель Google DeepMind, третий Flash-релиз за шесть недель; набирает 73,7% на агентном кодинг-бенчмарке DeepSWE v1.1 (почти вровень с Claude Opus 5 — 74,0%) при вводной цене $0,75/$3,75 за 1M токенов, доступ тольк…
ТекстПлатные (облако)
Gemini 3.8 Flash Cyber
специализированный кибербезопасный вариант Gemini 3.8 Flash от Google для проактивной защиты сетей госструктур и операторов критической инфраструктуры; веса закрыты, доступ выдаётся только проверенным организациям через программу Fairwind (…
ТекстПлатные (облако)
Muse Spark 1.3
мультимодальная reasoning-модель Meta с контекстом 1 048 576 токенов, принимает текст, изображения, видео, PDF и аудио; заточена под длинные агентные и multi-agent workflow и тратит примерно на 20% меньше вызовов инструментов и на 25% меньш…
ВидеоПлатные (облако)
Qwen3.8-Max-0902
обновлённый снапшот флагмана Alibaba Qwen: 2,4T параметров и контекст 1M токенов, дополнительно дообучен на кодинге и офисных «Cowork»-сценариях…
ТекстПлатные (облако)
Qwen-Drive-1.0
VLM (vision-language model, зрение+язык) от команды Qwen для автономного вождения на базе Qwen3.5-4B: объединяет 3D-восприятие через BEV-голову (bird's-eye-view, вид сверху), визуальные вопросы-ответы и планирование траектории эго-автомобил…
МультимодальныеOpen-Source (локально)
UI-Venus-2
GUI-агент от Venus Team (Ant Group) в версиях 9B и 27B, управляет мобильными приложениями, вебом и десктопной ОС только по скриншотам; обучен на 170+ мультиязычных приложениях…
ТекстOpen-Source (локально)
H3-World
интерактивная world-model, превращающая 33B видеогенератор MiniMax-H3 в управляемую естественным языком среду: точное управление персонажем и камерой достигается LoRA-дообучением всего 0,199% параметров плюс temporal attention routing…
ВидеоOpen-Source (локально)
ChatGPT Mil
закрытая версия ChatGPT от OpenAI, развёрнутая в защищённом контуре GenAI.mil Министерства войны США; ориентирована на административные задачи, логистику и планирование, веса недоступны, работа идёт внутри государственной инфраструктуры (ht…
ТекстПлатные (локально)
Grok for Government
вариант Grok от xAI (через Starshield AI), запущенный на платформе GenAI.mil Министерства войны США; применяется для анализа закупок и управления цепочками поставок, доступен только внутри государственного контура без публикации весов (http…
ТекстПлатные (локально)
Август
2026
📅 24.08
5 моделей
Laguna S 2.1
открытая MoE-модель (Mixture of Experts, смесь экспертов) на 118B параметров (8B активных) от Poolside для агентного кодинга, контекст 1M токенов, лицензия OpenMDW-1.1…
ТекстOpen-Source (локально)
Wan3.0-Video
закрытая text-to-video (T2V) модель Alibaba: ролики до 30 секунд в 480P–1080P из текста, изображений и документов (PDF/PPT) с референсным сохранением персонажей…
ВидеоПлатные (облако)
Thomson 1.0
первый собственный LLM Thomson Reuters: дообучен из открытой базы (Qwen) за $40 млн на корпусах Westlaw/Practical Law для юридических и налоговых задач, LegalBench 0.823…
ТекстOpen-Source (локально)
GLiNER2.5
семейство NER-моделей (извлечение именованных сущностей) от Fastino на энкодерах DeBERTa-v3: чекпоинты 74M/194M/287M параметров, лицензия Apache 2.0…
ТекстOpen-Source (локально)
GEN-1.5
закрытая робототехническая модель Generalist AI: мультимодальный трансформер (видео, сенсоры, язык, проприоцепция) с памятью 30 секунд и выдачей действий на 100 Гц…
ВидеоПлатные (локально)
📅 20.08
8 моделей
dots3-note Preview
Первая открытая модель Xiaohongshu (лаборатория dots.studio): MoE-архитектура (Mixture of Experts) на 280B параметров, 16B активных, контекст 512K токенов; понимает текст, изображения, видео и звук…
ВидеоOpen-Source (локально)
Ling-3.0-tiny-base
Базовая версия (без пост-тренинга) MoE-модели Ling-3.0-tiny от Ant Group: 7.9B параметров, из них 1.3B активных. Открыты чекпоинты трёх стадий обучения — претрейн, мидтрейн и финал — для дообучения под код и RL-исследования; лицензия MIT (h…
ТекстOpen-Source (локально)
Ling-3.0-flash-base
Базовая версия флагманской MoE-модели Ling-3.0-flash от Ant Group на 124B параметров (5.1B активных) с поддержкой длинного контекста…
ТекстOpen-Source (локально)
LFM2.5-DSpark
Черновые (draft) модели Liquid AI по ~300M параметров для спекулятивного декодирования LFM2.5: ускоряют инференс до 3,2 раза без изменения выходов — до 1362 токенов/с на H100 и 389 на MacBook…
ТекстOpen-Source (локально)
LFM2.5 QAD Q4_0
Q4_0 GGUF-чекпоинты моделей LFM2.5 (230M, 350M, 1.2B, 2.6B) от Liquid AI, обученные методом QAD — дистилляцией с учётом квантования, возвращающей 97% точности BF16 при том же размере…
ТекстOpen-Source (локально)
S1-mini
Открытая модель Superwhisper на 0.6B параметров (файнтюн Qwen3-0.6B), превращающая сырые транскрипты распознавания речи (ASR) в чистый текст: убирает слова-паразиты, расставляет пунктуацию, форматирует письма и списки…
АудиоOpen-Source (локально)
FastWan-QAD
Семейство моделей генерации видео Hao AI Lab на базе Wan2.x размерами 1.3B/5B/14B: дистилляция с учётом квантования (QAD) и трёхшаговый сэмплер позволяют RTX 5090 генерировать 5 секунд видео 480p за 1,8 секунды, а Mac — за ~30 секунд…
ВидеоOpen-Source (локально)
GEN-1.5
Робототехническая фундаментальная модель стартапа Generalist AI (основатели — выходцы из DeepMind и Boston Dynamics): vision-language-action архитектура обрабатывает видео, сенсоры и язык и выдаёт действия с частотой 100 Гц…
ВидеоПлатные (локально)
📅 13.08
8 моделей
DeepSeek-V4-Pro
флагманская MoE-модель (Mixture of Experts) DeepSeek на 1,6T параметров (49B активных) с контекстом 1M токенов, официально вышедшая из четырёхмесячного превью; заточена под агентные задачи: поддержка Responses API, интеграция с Codex и спек…
ТекстOpen-Source (локально)
Qwen3.8-2.4T-A95B
первый открытый флагман уровня Max от Alibaba Qwen: MoE-модель на 2,4T параметров (95B активных, 512 экспертов на слой) с контекстом 262K токенов, расширяемым до ~1M; работает в режиме размышлений по умолчанию и набирает 93,0 на PaperBench…
ТекстOpen-Source (локально)
Motif-3
финальный релиз открытой MoE-модели южнокорейской Motif Technologies на 314B параметров (13,2B активных) с фирменным вниманием GDLA и контекстом 256K токенов; обучена на 12,5T токенов и набирает 47 баллов на Artificial Analysis Intelligence…
ТекстOpen-Source (локально)
Ling 3.0 Flash
открытая MoE-модель inclusionAI (Ant Group) на 127B параметров; по данным Artificial Analysis — самая умная открытая модель среди систем с менее чем 124B суммарных параметров (38 баллов AAII), галлюцинации снижены с 97% до 44% в тесте Omnis…
МультимодальныеOpen-Source (локально)
Intern-S2-Preview-397B
научная агентная мультимодальная MoE-модель Shanghai AI Laboratory (InternLM) на 397B параметров (~120B активных) с опциональным модулем памяти Intern-MemDec-4B; умеет понимать, рассуждать и генерировать в научных задачах, включая прогнозир…
МультимодальныеOpen-Source (локально)
Gemini 3.7 Flash
закрытая модель Google для кодинга и агентных рабочих процессов, вышедшая всего через три недели после Gemini 3.6 Flash; контекст 1M токенов с мультимодальным вводом, рост FrontierCode 1.1 с 34,4% до 43,6% и DeepSWE v1.1 с 49% до 65,3%; дос…
МультимодальныеПлатные (облако)
Palmyra X6
флагманская модель Writer для корпоративных агентных задач, пост-тренировочная вариация открытой GLM-5.2 от Z.ai; генерирует 82 токена/с, выполняет задачи в среднем за 26 секунд и до 8 часов работает автономно без дрейфа; доступна только че…
ТекстПлатные (облако)
Dyna-2
world-action модель Dyna Robotics для манипуляции роботами, обученная на более чем 1M часов эгоцентрического видео людей; на видео-диффузионной основе совместно денойзит будущее видео и чанк действий, впервые перенося scaling-законы zero-sh…
ВидеоПлатные (локально)
📅 12.08
5 моделей
Grok 4.6
Флагманская закрытая модель xAI (SpaceXAI): ~1,5T параметров, контекст 500K токенов, заточена под долгоработающих агентов, кодинг и визуальные проекты; $2/$6 за 1M токенов…
ТекстПлатные (облако)
Qwen3.8-2.4T-A95B
Гигантская текстовая модель Alibaba Qwen на MoE-архитектуре (Mixture of Experts): 2,4T параметров, 95B активных; нативный контекст 262K, расширяется до 1M токенов…
ТекстOpen-Source (локально)
DeepSeek V4 Pro 0813
Стабильная версия флагманской закрытой модели DeepSeek V4 Pro: контекст 1M токенов, вывод до 384K, поддержка Responses API и Anthropic-совместимого эндпоинта…
ТекстПлатные (облако)
LFM2.5-VL-3B
Компактная vision-language модель (VLM) от Liquid AI на 3,1B параметров: текстовый бэкбон LFM2.5-2.6B + энкодер зрения SigLIP2 NaFlex 400M — для edge-устройств и локальных агентов: чтение UI, OCR, вызов функций…
МультимодальныеOpen-Source (локально)
North Micro Vision Instruct
Самая маленькая VLM от Cohere на 2,4B параметров (энкодер зрения 400M + LLM North Micro 2B) для документного понимания: извлечение структурированных данных, таблицы и мультиязычные изображения в нативном разрешении…
МультимодальныеOpen-Source (локально)
📅 11.08
7 моделей
Nemotron 3.5 Lightning
30B-параметрическая MoE-модель (Mixture of Experts — смесь экспертов, 3B активных на токен) от NVIDIA с гибридной Mamba-2–Transformer-архитектурой и контекстом до 1M токенов; ориентирована на высокоскоростные агентные задачи: code review, t…
ТекстOpen-Source (локально)
Muse Glimmer
30B-параметрическая плотная (Dense) мультимодальная causal-модель от Meta Superintelligence Labs с ViT-G/14-визуальным энкодером (~2B), контекстом 131K токенов и поддержкой 100+ языков; заточена под always-on-агентов на потребительских GPU…
МультимодальныеOpen-Source (локально)
Ling-3.0-tiny
сверхкомпактная MoE-модель от Ant Group/InclusionAI (Китай) на 7.9B параметров, всего 1.3B активных на токен (128 экспертов, 8 активных + 1 shared); гибридное внимание — чередование KDA (Kimi Dilation Attention от Moonshot AI) и MLA (Multi-…
ВидеоOpen-Source (локально)
LTX-2.5
опенвейт-модель мира (world model) от компании LTX (экс-Lightricks, Израиль) для генерации видео, робототехники и физического ИИ; новый диффузионный видеодекодер + языковой backbone Gemma 4, нативная многокадровая (multishot) генерация с со…
ВидеоOpen-Source (локально)
Fastino-Nemotron-3.5-Lightning-Finance
доменно-специализированная финансовая модель от Fastino Labs, полученная посттренингом NVIDIA Nemotron 3.5 Lightning (30B MoE, 3B активных) полностью автономным файнтюнинг-агентом менее чем за 10 часов. Лицензия Apache 2.0…
ТекстOpen-Source (локально)
Fastino-Nemotron-3.5-Lightning-Healthcare
доменно-специализированная медицинская модель от Fastino Labs, также созданная автономным посттренингом Nemotron 3.5 Lightning под Apache 2.0…
ТекстOpen-Source (локально)
GPT-5.6-Cyber
закрытая кибербезопасная модель OpenAI на базе флагманского GPT-5.6 Sol, специально дообученная под поиск zero-day-уязвимостей, разработку эксплойтов, пентесты и анализ защищённости; выполняет 95% продвинутых offensive-задач (exploit chain…
ТекстПлатные (облако)
📅 07.08
4 модели
smolvla_so101_tb4_pick_place_Sujith_080726_aug
компактная VLA (vision-language-action) модель на 0.5B параметров от MoAIBo, оптимизированная для задач робототехники, таких как захват и перемещение объектов; веса доступны на HuggingFace (https://huggingface.co/MoAIBo/smolvla_so101_tb4_pi…
МультимодальныеOpen-Source (локально)
OpenAI Astra
новая мультимодальная модель от OpenAI, которая стала предметом обсуждения из-за потенциальных рисков в сфере кибербезопасности; доступ предоставляется исключительно через закрытый API (https://the-decoder.com/openai-flags-imposes-its-new-a…
МультимодальныеПлатные (облако)
GPT-5.6 Sol
обновленная версия модели от OpenAI, интегрированная в сервис ChatGPT для улучшения качества ответов; доступ к расширенным возможностям ограничен для пользователей бесплатного тарифа (https://the-decoder.com/openai-improves-gpt-5-6-sol-in-c…
ТекстПлатные (облако)
Claude 5 Series
семейство моделей (Opus и Sonnet) от Anthropic, для которых сегодня были представлены критические обновления механизмов биологической безопасности; доступ осуществляется через API и подписку (https://www.anthotpic.com/news)
ТекстПлатные (облако)
📅 05.08
8 моделей
Qwen3.8-Max
флагманская мультимодальная MoE-модель (Mixture of Experts) от Alibaba на 2,4 трлн параметров (~95 млрд активных) с контекстом 1 млн токенов; понимает текст, изображения, аудио и видео, умеет автономно управлять компьютером (computer use)…
ВидеоПлатные (облако)
Meta Muse Spark 1.2
модель для кодинга от Meta Superintelligence Labs под руководством Александрa Ванга; ко-тренировалась в паре с агентом Muse Code на разнообразных dev-окружениях…
ТекстПлатные (облако)
Meta Muse Code
первый AI-агент для программирования от Meta; терминальное приложение (macOS/Linux), умеет планировать изменения, писать код и валидировать результаты в больших репозиториях…
ТекстПлатные (облако)
NVIDIA Alpamayo 2 Super
открытая модель рассуждений для автономного вождения от NVIDIA на 34 млрд параметров (~3× предыдущее поколение), построена на архитектуре Cosmos 3 Super Reasoner с пост-тренингом через reinforcement learning…
ТекстOpen-Source (локально)
Liquid AI LFM2.5-2.6B
компактная модель на 2,69 млрд параметров от MIT-спин-оффа Liquid AI для запуска AI-агентов полностью на устройстве (смартфон, ноутбук, робот) без облака…
ТекстOpen-Source (локально)
Mistral Shieldstral 1.0-3B
открытый мультимодальный классификатор безопасности от Mistral AI на 3 млрд параметров, умещающийся на одной 16 ГБ GPU. Вместо жёстко заданных категорий вреда принимает политику модерации в виде вопроса на естественном языке (policy-as-inpu…
МультимодальныеOpen-Source (локально)
AntBabel Ling-3.0-flash
открытая MoE-модель от Ant Group (inclusionAI) на 124 млрд параметров (всего 5,1 млрд активных на токен) с гибридным линейным вниманием: 35 слоёв KDA (Kimi Delta Attention) чередуются с 7 слоями MLA (Multi-head Latent Attention) в пропорции…
ТекстOpen-Source (локально)
Tencent Hy3
флагманская модель Tencent (ранее Hunyuan) на 295 млрд параметров / 21 млрд активных, архитектура MoE со 192 экспертами (top-8) и гибридным fast-and-slow-thinking…
ТекстOpen-Source (локально)
📅 04.08
9 моделей
Qwen3.8-Max
флагманская MoE-модель (Mixture of Experts) от Alibaba Qwen на 2.4T параметров (~95B активных) с контекстом 1M токенов и нативным мультимодальным пониманием (текст, изображения, видео); API $2/$6 за 1M токенов, веса обещаны открыть на следу…
ВидеоПлатные (облако)
MiniMax H3
omni-модальная generative-модель от MiniMax для создания видео 4–15 секунд в 2K-разрешении с нативным стереозвуком 32kHz; понимает текст, изображения, видео и аудио на 11 языках; веса открыты под Community License на HuggingFace, #1 в мире…
ВидеоOpen-Source (локально)
Alpamayo 2 Super
VLA-модель (vision-language-action) от NVIDIA для L4-автономного вождения (~32B параметров), построена на базе Cosmos 3 Super Reasoner с пост-тренировкой reinforcement learning; обеспечивает 360° восприятие с семи камер и выдаёт пять связан…
МультимодальныеOpen-Source (локально)
GPT-Live
голосовая full-duplex-система третьего поколения от OpenAI для ChatGPT Voice, позволяющая AI слушать и говорить одновременно без детектора окончания реплики; архитектура разделяет быстрый голосовой обмен и тяжёлый reasoning (делегируется ba…
АудиоПлатные (облако)
Ling 3.0 Flash FP8
открытая гибридно-линейная MoE-модель от InclusionAI (Ant Group) на 124B параметров (5.1B активных) с контекстом 262K токенов; FP8-квантизация, лицензия MIT, два режима — thinking и non-thinking; SGLang HiCache + Mooncake-кэширование сокращ…
ТекстOpen-Source (локально)
LFM2.5-2.6B
гибридная модель на 2.69B параметров от Liquid AI (MIT CSAIL spin-out) для on-device-агентов: планирование, tool-calling, многошаговые задачи; 128K контекст, менее 2.5 GB на CPU, 220 tok/s на Apple M5 Max и ~30 tok/s на телефоне; 22 свёрточ…
ТекстOpen-Source (локально)
NemotronLabs VoiceChat 11B
первая открытая full-duplex-голосовая модель от NVIDIA, способная вызывать инструменты (tool calling) прямо во время разговора; единая streaming-сеть: Fast Conformer-энкодер (16kHz) + Nemotron Nano v2 9B (гибрид Mamba/Transformer) + TTS-дек…
АудиоOpen-Source (локально)
SenseNova U1.5-Lite-Preview
унифицированная мультимодальная модель от SenseTime (商汤) на архитектуре NEO-Unify, всего 8B-MoT параметров, но с нативной генерацией 4K-изображений, точным редактированием и вёрсткой текста (постеры, инфографика); объединяет понимание, гене…
МультимодальныеOpen-Source (локально)
Hy ASR 3.0 preview
модель распознавания речи от Tencent Hunyuan (腾讯混元) на базе MoE-архитектуры Hy3 LLM с самообучающимся речевым энкодером (десятки миллионов часов аудио); объединяет высокоточную транскрипцию с семантическим пониманием контекста; WER 3.34% (м…
АудиоБесплатные (облако)
📅 03.08
4 модели
Qwen3.8-Max
Флагманская MoE-модель (Mixture of Experts) Alibaba/Qwen Team на 2.4T параметров (95B активных) с контекстом 1M токенов и нативной мультимодальностью (текст, изображения, видео)…
ВидеоПлатные (облако)
MiniMax H3
Омни-модальная система генерации видео от MiniMax: dense DiT-трансформер на 33B параметров генерирует видео до 15 сек (768p, 24 FPS) с нативным стереозвуком 32 кГц по тексту, изображениям, видео и аудио (до 9 изображений, 3 видео и 3 аудио…
ВидеоOpen-Source (локально)
Cogent AI VR-1
Специализированная reasoning-модель от Cogent AI для кибербезопасности: составляет и верифицирует полные цепочки атаки на предприятие — cloud, identity, runtime, CI/CD, SaaS — а не ищет отдельные уязвимости…
ТекстПлатные (облако)
ByteDance Seedance 2.5
Модель генерации видео нового поколения от ByteDance Seed Team: единый проход до 30 сек видео с синхронизированным аудио (против 15 сек у Seedance 2.0), до 50 референсных ассетов (изображения, видео, аудио, 3D white-model, хромакей), timest…
ВидеоПлатные (облако)
📅 01.08
3 модели
Nanbeige4.2-3B
агентная модель от Nanbeige Lab (подразделение BOSS Zhipin, Пекин) на 3B параметров с архитектурой Looped Transformer — веса трансформера переиспользуются за два прохода, увеличивая ёмкость без роста параметров…
ТекстOpen-Source (локально)
AMD Instella-MoE-16B-A3B
полностью открытая MoE-модель (Mixture of Experts — смесь экспертов) от AMD на 16B общих параметров (2.8B активных на токен), обучена с нуля на 7.1T токенов на ускорителях Instinct MI300X/MI325X…
ТекстOpen-Source (локально)
Jina Reranker v3.5
списочный реранкер (listwise reranker) на 0.6B параметров от Jina AI с гибридным вниманием 3L2G (sliding window + global attention), снижающим вычислительную сложность с квадратичной до линейной…
ТекстOpen-Source (локально)
Июль
2026
📅 30.07
9 моделей
Grok Voice Think Fast 2.0
SpaceXAI (xAI), next-gen speech-to-speech модель на базе Grok 4.5: занимает 1-е место на Tau Voice agent benchmark (56.5%) и 2-е на Artificial Analysis Speech-to-Speech Index (82.9%), время первого аудио-ответа — 0.70 сек; цена $0.08 за ауд…
АудиоПлатные (облако)
Grok 4.5
SpaceXAI (xAI), флагманская MoE-модель (Mixture of Experts) на 1.5 трлн параметров с контекстным окном до 500K токенов; SWE-Bench Pro — 64.7% (выше GPT-5.5 и Opus 4.7), Terminal-Bench 2.1 — 83.3%, скорость инференса 80 TPS; цена $2 за 1M вх…
ТекстПлатные (облако)
Gemini Robotics ER 2
Google DeepMind, VLM (vision-language model) для embodied reasoning — «высокоуровневый мозг» робота: понимает непрерывное видео, отслеживает прогресс задачи, сам исправляет ошибки, планирует многошаговые операции длительностью в несколько м…
ВидеоПлатные (облако)
Gemini Robotics 2
Google DeepMind, VLA-модель (vision-language-action) для полного телесного управления гуманоидными роботами: от ходьбы и приседаний до мелкой моторики 22-степенных кистей (92% точности выкручивания лампочки, 76.3% — захват предметов с полки…
ВидеоПлатные (облако)
Gemini Robotics On-Device 2
Google DeepMind, компактная VLA-модель, работающая локально на устройстве робота без облачных запросов; адаптируется к новым конфигурациям роботов за несколько часов дообучения; early-access для партнёров (https://deepmind.google/blog/gemin…
МультимодальныеПлатные (облако)
Inkling Small
Thinking Machines Lab (основана Мирой Мурати, экс-CTO OpenAI), MoE-трансформер на 276B всего / 12B активных параметров (6 из 256 экспертов), мультимодальный — текст + изображения + аудио на входе, контекст до 1M токенов; лицензия Apache 2.0…
ВидеоOpen-Source (локально)
VisionPsy-Nano
Tether Data (подразделение QVAC), сверхкомпактная VLM на ∼460M параметров: SigLIP2-вижн-энкодер + SmolLM2-360M-языковая основа, контекст 8192 токена, поддержка тайлинга изображений до 2048px; лицензия Apache 2.0; лучшая среди всех sub-0.5B…
МультимодальныеOpen-Source (локально)
Gemini Spark
Google, персональный AI-агент на базе Gemini 3.5/3.6, работающий 24/7 в фоне (даже при заблокированном экране или закрытом ноутбуке) на облачных виртуальных машинах Google; нативно интегрирован с Google Workspace (Gmail, Docs, Sheets, Calen…
ТекстБесплатные (облако)
Lyria 3.5
Google DeepMind, нейросеть для генерации музыки: улучшенная мелодичность (богатые, естественные переходы между секциями), более реалистичный вокал с эмоциональной экспрессией и точным произношением, гибкое управление темпом (BPM) и длительн…
АудиоПлатные (облако)
📅 29.07
12 моделей
A.X K2
флагманская MoE-модель (Mixture of Experts) на 688B параметров (33B активных на токен) от SK Telecom, крупнейшая в суверенной AI-программе Южной Кореи; декодер-трансформер с 256 экспертами, контекст 262K токенов (расширяется до 512K через Y…
ТекстOpen-Source (локально)
A.X K2 ALM
аудио-языковая модель (Audio Language Model) на 22B параметров от SK Telecom, предназначена для анализа голосовых звонков, консультаций и совещаний; способна распознавать и интерпретировать аудио из контакт-центров и производственных сред…
АудиоOpen-Source (локально)
A.X K2 Raon-Speech
голосовая AI-модель на 21B параметров (3B активных), совместная разработка Krafton и SK Telecom для игровых AI-персонажей; комбинирует малую языковую модель A.X K2 с голосовым энкодером и кодеком Krafton для прямого понимания и генерации ре…
АудиоOpen-Source (локально)
GPT Transcribe
модель распознавания речи от OpenAI для асинхронной транскрипции аудиофайлов и batch-нагрузок; работает в ~34 раза быстрее реального времени, Word Error Rate 3.31% (против 40.37% у Whisper на Common Voice), поддерживает контекстные подсказк…
АудиоПлатные (облако)
GPT Live Transcribe
потоковая модель распознавания речи OpenAI для реального времени: живые субтитры, транскрипция звонков, микрофонный ввод; пониженная задержка по сравнению с GPT Transcribe, улучшенное понимание акцентов и технической терминологии в зашумлён…
ТекстПлатные (облако)
Lyria 3.5
модель генерации музыки от Google DeepMind, запущена в Google Flow Music; улучшенная мелодичность, реалистичный вокал с эмоциональными нюансами, структурное понимание текстов песен (куплеты, припевы); пользователь управляет темпом (BPM) и д…
АудиоПлатные (облако)
LFM2.5-Encoder-230M и LFM2.5-Encoder-350M
семейство bidirectional-энкодеров от Liquid AI на гибридной архитектуре LFM2 (gated convolution + grouped-query attention), адаптированных из decoder-моделей под понимание текста (MLM с 30% masking rate, контекст 8192 токена); на CPU при по…
ТекстOpen-Source (локально)
Pangram 4
модель детекции AI-сгенерированного текста от Pangram Labs (Стэнфорд), построена на MoE-архитектуре (Mixture of Experts) со специализированными головами для детекции «очеловечивателей» (humanizer-обход), посегментного анализа и смешанного а…
ТекстПлатные (облако)
Shieldstral
мультимодальный классификатор безопасности на 3B параметров от Mistral AI, формулирует модерацию контента как бинарный вопросно-ответный task; одна модель обрабатывает текст и изображения одновременно, политика модерации задаётся естественн…
МультимодальныеOpen-Source (локально)
MODUS
декодерная any-to-any-модель от EPFL VILAB (совместно с Apple, U. Copenhagen, CUHK и Lambda AI) для генерации 16 модальностей (RGB, глубина, нормали, сегментация, Canny-границы, SAM-маски, DINOv2/CLIP/ImageBind-фичи и др.) в едином causal-т…
ТекстOpen-Source (локально)
GPT-Red
фреймворк автоматизированного red-teaming от OpenAI, использующий self-play (самоигру) для масштабного поиска уязвимостей языковых моделей; опубликован как исследовательская статья 29 июля с кодом; вместо ручного тестирования модель-атакующ…
ТекстOpen-Source (локально)
Mage-VL
лёгкая потоковая multimodal-модель от Microsoft на 4B параметров для понимания видео: изображения, frame-сэмплированное видео, H.264/HEVC-видео и event-gated-стриминг; визуальный энкодер Mage-ViT (с нуля) + Qwen3-4B-Instruct как языковой ba…
ВидеоOpen-Source (локально)
📅 27.07
7 моделей
Kimi K3
Открытая MoE-модель (Mixture of Experts) на 2,8 трлн параметров (~50B активных, 896 экспертов с top-16 роутингом) от китайской Moonshot AI…
ТекстOpen-Source (локально)
NVIDIA Cosmos-H-Dreams
Генеративный симулятор реального времени для хирургической робототехники от NVIDIA: causal-модель, дистиллированная из Cosmos-Predict2.5-2B методом self-forcing distillation…
ТекстOpen-Source (локально)
MAI-Cyber-1-Flash
Первая специализированная кибербезопасная модель Microsoft: компактный дериватив MAI-Thinking-1 (~10× меньше GPT-5.4), заточенный под поиск, верификацию и исправление уязвимостей в коде…
ТекстПлатные (облако)
Celeris-1
Диффузионная языковая модель от стартапа Celeris (основатели Tom Hamer и Jesse Clark — экс-Margo, backed by Lightspeed Venture Partners): генерирует текст не авторегрессивно, а параллельным уточнением «черновика» всего ответа за несколько п…
ТекстПлатные (облако)
Claude Opus 5 (Anthropic)
выпущен 24 июля, широко освещался 27 июля, но не является релизом этой даты
ТекстПлатные (облако)
Muse Spark 1.1 (Meta)
модель от 9 июля; развёртывание agentic-функций Meta AI стартовало 27 июля, но сама модель не новая
ТекстOpen-Source (локально)
AgentENV (Kimi AI / kvcache-ai)
инфраструктура для agentic RL, а не AI-модель; опенсорснут 27 июля вместе с K3
ТекстOpen-Source (локально)
📅 23.07
3 модели
Solar Open 2
открытая агентная LLM от Upstage (Южная Корея) в рамках госинициативы «суверенной модели»; MoE-архитектура (Mixture of Experts) на 250B параметров с 15B активных, оптимизирована под повторяющиеся рассуждения и вызовы инструментов…
ТекстOpen-Source (локально)
Laguna S 2.1
компактная модель для агентного кодинга от Poolside; MoE на 118B параметров (8B активных), контекст до 1M токенов, режимы с рассуждениями и без…
ТекстOpen-Source (локально)
FLUX 3
мультимодальная frontier-модель от Black Forest Labs (Германия): единая архитектура для изображений, видео и звука с возможностью предсказания действий для робототехники…
ВидеоПлатные (облако)
📅 22.07
4 модели
Solar Open 2 (Solar-Open2-250B)
открытая LLM от корейской Upstage: MoE-архитектура (Mixture of Experts) на 250B параметров с 15B активными, гибридное внимание (линейные слои + softmax, без позиционных кодировок NoPE) и контекст до 1M токенов; заточена под агентные задачи…
ТекстOpen-Source (локально)
Antares-350M / Antares-1B
семейство компактных моделей (SLM, small language model) на 350M и 1B параметров от Cisco Foundation AI для локализации известных уязвимостей прямо в больших кодовых базах; работают on-prem без выгрузки исходников в облако, дают уровень GPT…
ТекстOpen-Source (локально)
TimeLens2
мультимодальная LLM для универсального temporal grounding в видео (поиск нужных моментов по текстовому запросу) от лаборатории MCG-NJU (Нанкинский университет); код и веса открыты на GitHub, статья вышла в топ-1 трендовых на HuggingFace за…
ВидеоOpen-Source (локально)
Cursor Router
обученный командой Cursor классификатор уровня запроса (request-level classifier), который маршрутизирует каждый запрос к оптимальной модели по сложности и типу задачи, обеспечивая фронтир-качество кодинга при затратах на 30–50% ниже; закры…
ТекстПлатные (облако)
📅 20.07
3 модели
NVIDIA Cosmos 3 Edge
открытая world-модель («модель мира») на 4B параметров от NVIDIA с двумя трансформерными «башнями» (авторегрессионная для reasoning + диффузионная для генерации действий); помогает роботам понимать окружение и генерировать до 32 действий за…
ТекстOpen-Source (локально)
RynnBrain 1.1
embodied-модель (воплощённый ИИ) от Alibaba DAMO Academy и Hupan Lab в трёх размерах (2B, 9B и 122B-A10B) на базе Qwen3.5; decoder-only VLM (vision-language-модель) для пространственного reasoning, локализации объектов, планирования манипул…
МультимодальныеOpen-Source (локально)
Qwen-Audio-3.0-TTS
закрытая облачная TTS-модель (text-to-speech, синтез речи) от Alibaba Tongyi Lab в тирах Flash (~300мс задержка) и Plus (качество); поддержка 16 языков и 20 китайских диалектов, клонирование голоса и 86 тегов эмоций, доступ только через API…
АудиоПлатные (облако)
📅 17.07
2 модели
Nemotron 3 Embed
семейство открытых эмбеддинг-моделей от NVIDIA (чекпоинты 8B и 1B, трансформер-энкодер с двунаправленным вниманием на базе Ministral, контекст 32K токенов, 34 языка) для RAG (генерация с поиском по базе), агентного и кодового поиска; 8B-вер…
ТекстOpen-Source (локально)
ZUNA1.1
открытая foundation-модель для ЭЭГ (электроэнцефалографии) от Zyphra на 380M параметров; диффузионный автоэнкодер на трансформере с 4D-ротационным кодированием координат (x, y, z, t), принимает сигналы переменной длины 0.5–30 сек, восстанав…
ТекстOpen-Source (локально)
📅 15.07
4 модели
Inkling
открытая (open-weight) мультимодальная MoE-модель (Mixture of Experts) от Thinking Machines Lab Миры Мурати: 975B параметров (41B активных), обучена на 45 трлн токенов текста/изображений/аудио/видео, контекст до 1M токенов, регулируемое «ус…
ВидеоOpen-Source (локально)
Inkling-Small
облегчённая версия флагмана Thinking Machines Lab: открытая мультимодальная MoE-модель на 276B параметров (12B активных), обучена по схожему рецепту; позиционируется как основа для дообучения через платформу Tinker (превью) (https://thinkin…
ВидеоOpen-Source (локально)
Bonsai 27B
открытая reasoning-модель для запуска на устройстве от PrismML (основана исследователями Caltech) на базе Qwen3.6-27B; экстремальная 1–1.58-битная квантизация ужимает 27B до ~3.9 ГБ и запускает модель локально на iPhone 17 Pro (~11 ток/с)…
ТекстOpen-Source (локально)
Soofi S 30B-A3B
открытая суверенная двуязычная (немецкий/английский) foundation-модель немецкого консорциума Soofi (Fraunhofer IAIS, DFKI, TU Darmstadt): гибридная MoE-архитектура Mamba-Transformer, ~31.6B параметров (3.2B активных), контекст до 1M токенов…
ТекстOpen-Source (локально)
📅 12.07
3 модели
NeuroVFM
нейровизуализационная foundation-модель от команды University of Michigan (публикация в Nature Medicine); vision-only self-supervised энкодер на 85.8M параметров (есть вариант 21.7M), обучен методом Vol-JEPA (расширение I-JEPA/V-JEPA на объ…
МультимодальныеOpen-Source (локально)
Vidu S1
модель интерактивной генерации видео в реальном времени от Tsinghua University и Shengshu AI; на базе диффузионных фреймворков TurboDiffusion/TurboServe…
ВидеоБесплатные (облако)
DrugGen 2
disease-aware языковая модель для поиска лекарств от Isfahan University of Medical Sciences (Иран); дообученная GPT-2 с двухэтапным обучением (SFT на 13 908 парах болезнь-мишень-препарат + оптимизация GRPO)…
ТекстOpen-Source (локально)
📅 11.07
1 модель
LingBot-VA 2.0
video-action (видео-действие) foundation-модель для универсального управления роботами-манипуляторами от Robbyant (подразделение embodied AI в составе Ant Group); causal Diffusion Transformer (диффузионный трансформер) на ~15.3B параметров…
ВидеоOpen-Source (локально)
📅 10.07
5 моделей
MuScriptor
от Kyutai и команды Mirelo; декодер-only Transformer в трёх размерах (103M / 307M / 1.4B параметров), транскрибирует многоинструментальную музыку из аудио (мел-спектрограмм) в MIDI…
АудиоOpen-Source (локально)
OpenCoF
от ByteDance Seed; видео-модель, дообученная поверх Wan2.2-I2V-A14B с MoE-архитектурой (Mixture of Experts) и блоками DiT (Diffusion Transformer, ~14B параметров), реализует Chain-of-Frame рассуждения через генерацию видео…
ВидеоOpen-Source (локально)
SAM-MT
от Fudan University; расширение Segment Anything 2 для сегментации нескольких объектов в видео в реальном времени, использует раздельный masked-attention и query-based память; держит 36+ FPS на 10 целях там, где SAM2 падает до 12.4 FPS (htt…
ВидеоOpen-Source (локально)
DrugGen 2
от Isfahan University of Medical Sciences; языковая модель на базе GPT-2, дообученная через SFT и RL-метод GRPO (Group Relative Policy Optimization), генерирует молекулы-кандидаты по онтологии болезни и последовательности белка-мишени для d…
ТекстOpen-Source (локально)
SensorFM
от Google Research; foundation-модель для носимых устройств на базе ViT-1D (одномерный Vision Transformer) с masked-autoencoder, до 110M+ параметров, обучена на 1 трлн минут сенсорных сигналов от 5 млн человек; решает 35 задач прогноза здор…
МультимодальныеБесплатные (облако)
📅 09.07
8 моделей
GPT-5.6 Sol
флагманская закрытая reasoning-модель OpenAI, старшая в трёхуровневом семействе; заточена под сложный кодинг, кибербезопасность, науку и долгие агентные задачи, набирает 80 в Artificial Analysis Coding Agent Index (выше Claude Fable 5) и 91…
ТекстПлатные (облако)
GPT-5.6 Terra
средняя сбалансированная модель OpenAI с производительностью на уровне GPT-5.5, но вдвое дешевле; универсальный «повседневный» вариант для агентов и автоматизации, поддерживает Programmatic Tool Calling (запуск JS-кода в изолированном V8)…
ТекстПлатные (облако)
GPT-5.6 Luna
самая быстрая и дешёвая модель семейства OpenAI GPT-5.6, оптимизирована под высокую пропускную способность и объёмные нагрузки; даёт 84.3% на Terminal-Bench 2.1 при минимальной цене; закрытая, доступ через API ($1/$6 за 1M токенов) (https:/…
ТекстПлатные (облако)
Grok 4.5
новая закрытая модель xAI класса Opus для кодинга и агентных задач с контекстом 500K токенов и встроенными серверными инструментами (веб-поиск, поиск по X, исполнение кода); #4 из 168 в Artificial Analysis Intelligence Index и лучший резуль…
ТекстПлатные (облако)
Muse Spark 1.1
первая платная API-модель Meta Superintelligence Labs (уход от привычной open-weights стратегии Meta); мультимодальная reasoning-модель с контекстом 1M токенов, принимает текст, изображения, видео и документы, умеет tool use, автоматизацию…
ВидеоПлатные (облако)
Nemotron-Labs-3-Puzzle-75B-A9B
открытая гибридная MoE-модель (Mixture of Experts) от NVIDIA на 75.3B параметров (9.3B активных), архитектура из чередующихся Mamba-, MoE- и attention-блоков со сжатием от Nemotron-3-Super; даёт ~2× серверной пропускной способности и держит…
ТекстOpen-Source (локально)
GPT-Live-1
новая полнодуплексная голосовая модель OpenAI, заменяющая Advanced Voice Mode; непрерывно слушает и говорит одновременно, много раз в секунду решая говорить/слушать/перебить/вызвать инструмент, для сложных запросов делегирует фоновой fronti…
АудиоПлатные (облако)
GPT-Live-1 mini
облегчённая версия полнодуплексной голосовой модели OpenAI для бесплатного тарифа ChatGPT; та же архитектура естественного живого диалога (реакции «mhmm», паузы, перебивания), глобальный роллаут на iOS, Android и ChatGPT.com; бесплатно толь…
ТекстБесплатные (облако)
📅 07.07
3 модели
Cohere Transcribe Arabic
открытая модель распознавания речи (ASR) на 2B параметров от Cohere, заточена под арабский: диалекты, арабско-английский code-switching и спец-лексика; лицензия Apache 2.0, люди предпочли её Whisper в 95.8% тестов (WER 25.87 на HF Arabic AS…
АудиоOpen-Source (локально)
Nemotron-Labs-Audex-30B-A3B (Audex)
унифицированная аудио-текстовая MoE-модель (MoE — Mixture of Experts, «смесь экспертов») от NVIDIA: 30B параметров, 3B активных, гибрид Mamba-Transformer, контекст 1M токенов; умеет ASR, перевод речи, TTS (text-to-speech), генерацию аудио и…
АудиоOpen-Source (локально)
LingBot-Vision
открытая vision-модель (самообучаемый энкодер) от Robbyant (подразделение Ant Group) для плотного пространственного восприятия роботов; семейство ViT до 1.1B параметров, обучено на 161M изображений методом masked boundary modeling; в оценке…
МультимодальныеOpen-Source (локально)
📅 06.07
4 модели
Hy3
открытая языковая MoE-модель (Mixture of Experts) от Tencent Hunyuan: 295B параметров (21B активных), контекст 256K токенов, объединяет «быстрое» и «медленное» мышление с усиленными агентными возможностями; лицензия Apache 2.0, веса выложен…
ТекстOpen-Source (локально)
Wan-Streamer v0.2
интерактивная real-time (в реальном времени) foundation-модель от Wan-AI (Alibaba): единый трансформер потоково обрабатывает текст, аудио и видео и на входе, и на выходе через block-causal attention для полнодуплексного аудио-визуального об…
ВидеоOpen-Source (локально)
GigaWorld-1
world-model (модель мира) от GigaAI: задаёт методику построения моделей мира для оценки политик роботов в embodied AI (воплощённом ИИ), выступая симулятором для тестирования действий робота без реального железа; код и материалы открыты (htt…
ТекстOpen-Source (локально)
ZCode
облачный агент для кодинга от Zhipu AI (Z.ai) на базе модели GLM-5.2 с контекстом 1M токенов: умеет читать файлы, терминал и браузер, интегрируется с Git; работает только в облаке, бесплатный 5-дневный триал до 5M токенов в день (https://zc…
ТекстБесплатные (облако)
📅 03.07
1 модель
Leanstral 1.5
открытая MoE-модель (Mixture of Experts: 119B параметров, 6B активных, 128 экспертов, контекст 256K) от Mistral AI для формальной верификации и доказательства теорем в Lean 4; решает 587/672 задач PutnamBench, полностью «сатурирует» miniF2F…
ТекстOpen-Source (локально)
📅 02.07
1 модель
diffusion-gemma-asr-small
открытая мультиязычная ASR-модель (распознавание речи) от стартапа Interfaze (Y Combinator); адаптер на ~42M параметров поверх замороженного диффузионного бэкбона DiffusionGemma-26B и энкодера Whisper-small, транскрибирует 6 языков (EN/DE/F…
АудиоOpen-Source (локально)
📅 01.07
4 модели
Claude Sonnet 5
закрытая агентная LLM от Anthropic, ставшая 1 июля моделью по умолчанию для планов Free и Pro и доступная в Max/Team/Enterprise; умеет планировать, использовать инструменты (браузер, терминал) и работать автономно, показывая 63,2% на agenti…
ТекстПлатные (облако)
ABot-M0.5
vision-language-action (VLA, «зрение-язык-действие») мировая модель действий от команды AMAP CVLab (Alibaba) для мобильных роботов-манипуляторов…
МультимодальныеOpen-Source (локально)
VideoSearch-R1
агентная модель поиска и рассуждений по видео от исследователей Korea University (группа Hyunwoo J. Kim); обучена через RL-алгоритм GRPO с «мягким» уточнением запроса в латентном пространстве вместо переписывания текста, ставит SOTA на бенч…
ВидеоOpen-Source (локально)
DART / Domain Arithmetic
метод одношаговой (one-shot) адаптации VLA-моделей к смене окружения (ракурс камеры, другой робот — с Panda на UR5e) через арифметику весов и выравнивание сингулярных подпространств; от Taewook Kang и соавторов, превосходит существующие мет…
МультимодальныеOpen-Source (локально)
Июнь
2026
📅 27.06
1 модель
DeepSeek-V4-DSpark (Pro / Flash)
открытые ускоренные чекпоинты от DeepSeek AI на базе DeepSeek-V4: MoE-архитектура (Mixture of Experts) на 1.6T параметров (49B активных) с гибридным вниманием и контекстом 1M токенов…
ТекстOpen-Source (локально)
📅 26.06
3 модели
GPT-5.6 Sol
закрытая флагманская мультимодальная модель OpenAI с новым уровнем reasoning-усилия «max» и режимом «ultra» (использует суб-агентов для сложных задач); доступ только через API в ограниченном превью (~20 организаций, по согласованию с правит…
МультимодальныеПлатные (облако)
GPT-5.6 Terra
сбалансированная закрытая модель OpenAI для повседневной работы: сопоставима по качеству с GPT-5.5, но примерно вдвое дешевле; API only, цена $2.50 / $15 за 1M токенов, старт в ограниченном превью с поэтапным расширением доступа (https://he…
ТекстПлатные (облако)
GPT-5.6 Luna
самая быстрая и дешёвая модель линейки GPT-5.6 от OpenAI, рассчитана на высокообъёмные рутинные задачи; закрытый API, цена $1 / $6 за 1M токенов вход/выход, доступна пока только избранным партнёрам превью (https://help.openai.com/en/article…
ТекстПлатные (облако)
📅 25.06
4 модели
Ornith-1.0
семейство открытых моделей для кодинга от DeepReinforce в четырёх размерах (9B и 31B dense, а также 35B и 397B на MoE-архитектуре (Mixture of Experts), ~3B активных у 35B); построено поверх Gemma 4 и Qwen 3.5, выдаёт reasoning в <think>-бло…
ТекстOpen-Source (локально)
Gemini 3.5 Flash (Computer Use)
Google встроила управление компьютером напрямую в Gemini 3.5 Flash: модель видит экран и сама работает с браузером, ПК и мобильными устройствами для автотестов и офисной автоматизации…
МультимодальныеПлатные (облако)
ViQ
визуальный токенизатор от Tencent HY Vision Team (с Tsinghua, NTU, CAS) на 1.3B параметров на базе SigLIP2-g, преобразующий изображения любого разрешения в дискретные коды с сохранением семантики и качества реконструкции…
МультимодальныеOpen-Source (локально)
Qwen-Image-Agent
агентский фреймворк для генерации изображений от Alibaba Qwen: training-free, совместим с существующими генераторами, добавляет планирование, reasoning, веб/картиночный поиск и память для multi-image и multi-turn сценариев…
ИзображенияOpen-Source (локально)

← Назад к нейронкам