🚀 Open-Source и платные ИИ-модели
Календарь релизов 2025–2026
Отслеживайте последние релизы ИИ-моделей: от бесплатных open-source до платных облачных решений.
247
Дней отслеживается
144
Дней релизов
806
Моделей
–
Август
2026
📅 07.08
4 модели
smolvla_so101_tb4_pick_place_Sujith_080726_aug
компактная VLA (vision-language-action) модель на 0.5B параметров от MoAIBo, оптимизированная для задач робототехники, таких как захват и перемещение объектов; веса доступны на HuggingFace (https://huggingface.co/MoAIBo/smolvla_so101_tb4_pi…
OpenAI Astra
новая мультимодальная модель от OpenAI, которая стала предметом обсуждения из-за потенциальных рисков в сфере кибербезопасности; доступ предоставляется исключительно через закрытый API (https://the-decoder.com/openai-flags-imposes-its-new-a…
GPT-5.6 Sol
обновленная версия модели от OpenAI, интегрированная в сервис ChatGPT для улучшения качества ответов; доступ к расширенным возможностям ограничен для пользователей бесплатного тарифа (https://the-decoder.com/openai-improves-gpt-5-6-sol-in-c…
Claude 5 Series
семейство моделей (Opus и Sonnet) от Anthropic, для которых сегодня были представлены критические обновления механизмов биологической безопасности; доступ осуществляется через API и подписку (https://www.anthotpic.com/news)
📅 05.08
8 моделей
Qwen3.8-Max
флагманская мультимодальная MoE-модель (Mixture of Experts) от Alibaba на 2,4 трлн параметров (~95 млрд активных) с контекстом 1 млн токенов; понимает текст, изображения, аудио и видео, умеет автономно управлять компьютером (computer use)…
Meta Muse Spark 1.2
модель для кодинга от Meta Superintelligence Labs под руководством Александрa Ванга; ко-тренировалась в паре с агентом Muse Code на разнообразных dev-окружениях…
Meta Muse Code
первый AI-агент для программирования от Meta; терминальное приложение (macOS/Linux), умеет планировать изменения, писать код и валидировать результаты в больших репозиториях…
NVIDIA Alpamayo 2 Super
открытая модель рассуждений для автономного вождения от NVIDIA на 34 млрд параметров (~3× предыдущее поколение), построена на архитектуре Cosmos 3 Super Reasoner с пост-тренингом через reinforcement learning…
Liquid AI LFM2.5-2.6B
компактная модель на 2,69 млрд параметров от MIT-спин-оффа Liquid AI для запуска AI-агентов полностью на устройстве (смартфон, ноутбук, робот) без облака…
Mistral Shieldstral 1.0-3B
открытый мультимодальный классификатор безопасности от Mistral AI на 3 млрд параметров, умещающийся на одной 16 ГБ GPU. Вместо жёстко заданных категорий вреда принимает политику модерации в виде вопроса на естественном языке (policy-as-inpu…
AntBabel Ling-3.0-flash
открытая MoE-модель от Ant Group (inclusionAI) на 124 млрд параметров (всего 5,1 млрд активных на токен) с гибридным линейным вниманием: 35 слоёв KDA (Kimi Delta Attention) чередуются с 7 слоями MLA (Multi-head Latent Attention) в пропорции…
Tencent Hy3
флагманская модель Tencent (ранее Hunyuan) на 295 млрд параметров / 21 млрд активных, архитектура MoE со 192 экспертами (top-8) и гибридным fast-and-slow-thinking…
📅 04.08
9 моделей
Qwen3.8-Max
флагманская MoE-модель (Mixture of Experts) от Alibaba Qwen на 2.4T параметров (~95B активных) с контекстом 1M токенов и нативным мультимодальным пониманием (текст, изображения, видео); API $2/$6 за 1M токенов, веса обещаны открыть на следу…
MiniMax H3
omni-модальная generative-модель от MiniMax для создания видео 4–15 секунд в 2K-разрешении с нативным стереозвуком 32kHz; понимает текст, изображения, видео и аудио на 11 языках; веса открыты под Community License на HuggingFace, #1 в мире…
Alpamayo 2 Super
VLA-модель (vision-language-action) от NVIDIA для L4-автономного вождения (~32B параметров), построена на базе Cosmos 3 Super Reasoner с пост-тренировкой reinforcement learning; обеспечивает 360° восприятие с семи камер и выдаёт пять связан…
GPT-Live
голосовая full-duplex-система третьего поколения от OpenAI для ChatGPT Voice, позволяющая AI слушать и говорить одновременно без детектора окончания реплики; архитектура разделяет быстрый голосовой обмен и тяжёлый reasoning (делегируется ba…
Ling 3.0 Flash FP8
открытая гибридно-линейная MoE-модель от InclusionAI (Ant Group) на 124B параметров (5.1B активных) с контекстом 262K токенов; FP8-квантизация, лицензия MIT, два режима — thinking и non-thinking; SGLang HiCache + Mooncake-кэширование сокращ…
LFM2.5-2.6B
гибридная модель на 2.69B параметров от Liquid AI (MIT CSAIL spin-out) для on-device-агентов: планирование, tool-calling, многошаговые задачи; 128K контекст, менее 2.5 GB на CPU, 220 tok/s на Apple M5 Max и ~30 tok/s на телефоне; 22 свёрточ…
NemotronLabs VoiceChat 11B
первая открытая full-duplex-голосовая модель от NVIDIA, способная вызывать инструменты (tool calling) прямо во время разговора; единая streaming-сеть: Fast Conformer-энкодер (16kHz) + Nemotron Nano v2 9B (гибрид Mamba/Transformer) + TTS-дек…
SenseNova U1.5-Lite-Preview
унифицированная мультимодальная модель от SenseTime (商汤) на архитектуре NEO-Unify, всего 8B-MoT параметров, но с нативной генерацией 4K-изображений, точным редактированием и вёрсткой текста (постеры, инфографика); объединяет понимание, гене…
Hy ASR 3.0 preview
модель распознавания речи от Tencent Hunyuan (腾讯混元) на базе MoE-архитектуры Hy3 LLM с самообучающимся речевым энкодером (десятки миллионов часов аудио); объединяет высокоточную транскрипцию с семантическим пониманием контекста; WER 3.34% (м…
📅 03.08
4 модели
Qwen3.8-Max
Флагманская MoE-модель (Mixture of Experts) Alibaba/Qwen Team на 2.4T параметров (95B активных) с контекстом 1M токенов и нативной мультимодальностью (текст, изображения, видео)…
MiniMax H3
Омни-модальная система генерации видео от MiniMax: dense DiT-трансформер на 33B параметров генерирует видео до 15 сек (768p, 24 FPS) с нативным стереозвуком 32 кГц по тексту, изображениям, видео и аудио (до 9 изображений, 3 видео и 3 аудио…
Cogent AI VR-1
Специализированная reasoning-модель от Cogent AI для кибербезопасности: составляет и верифицирует полные цепочки атаки на предприятие — cloud, identity, runtime, CI/CD, SaaS — а не ищет отдельные уязвимости…
ByteDance Seedance 2.5
Модель генерации видео нового поколения от ByteDance Seed Team: единый проход до 30 сек видео с синхронизированным аудио (против 15 сек у Seedance 2.0), до 50 референсных ассетов (изображения, видео, аудио, 3D white-model, хромакей), timest…
📅 01.08
3 модели
Nanbeige4.2-3B
агентная модель от Nanbeige Lab (подразделение BOSS Zhipin, Пекин) на 3B параметров с архитектурой Looped Transformer — веса трансформера переиспользуются за два прохода, увеличивая ёмкость без роста параметров…
AMD Instella-MoE-16B-A3B
полностью открытая MoE-модель (Mixture of Experts — смесь экспертов) от AMD на 16B общих параметров (2.8B активных на токен), обучена с нуля на 7.1T токенов на ускорителях Instinct MI300X/MI325X…
Jina Reranker v3.5
списочный реранкер (listwise reranker) на 0.6B параметров от Jina AI с гибридным вниманием 3L2G (sliding window + global attention), снижающим вычислительную сложность с квадратичной до линейной…
Июль
2026
📅 30.07
9 моделей
Grok Voice Think Fast 2.0
SpaceXAI (xAI), next-gen speech-to-speech модель на базе Grok 4.5: занимает 1-е место на Tau Voice agent benchmark (56.5%) и 2-е на Artificial Analysis Speech-to-Speech Index (82.9%), время первого аудио-ответа — 0.70 сек; цена $0.08 за ауд…
Grok 4.5
SpaceXAI (xAI), флагманская MoE-модель (Mixture of Experts) на 1.5 трлн параметров с контекстным окном до 500K токенов; SWE-Bench Pro — 64.7% (выше GPT-5.5 и Opus 4.7), Terminal-Bench 2.1 — 83.3%, скорость инференса 80 TPS; цена $2 за 1M вх…
Gemini Robotics ER 2
Google DeepMind, VLM (vision-language model) для embodied reasoning — «высокоуровневый мозг» робота: понимает непрерывное видео, отслеживает прогресс задачи, сам исправляет ошибки, планирует многошаговые операции длительностью в несколько м…
Gemini Robotics 2
Google DeepMind, VLA-модель (vision-language-action) для полного телесного управления гуманоидными роботами: от ходьбы и приседаний до мелкой моторики 22-степенных кистей (92% точности выкручивания лампочки, 76.3% — захват предметов с полки…
Gemini Robotics On-Device 2
Google DeepMind, компактная VLA-модель, работающая локально на устройстве робота без облачных запросов; адаптируется к новым конфигурациям роботов за несколько часов дообучения; early-access для партнёров (https://deepmind.google/blog/gemin…
Inkling Small
Thinking Machines Lab (основана Мирой Мурати, экс-CTO OpenAI), MoE-трансформер на 276B всего / 12B активных параметров (6 из 256 экспертов), мультимодальный — текст + изображения + аудио на входе, контекст до 1M токенов; лицензия Apache 2.0…
VisionPsy-Nano
Tether Data (подразделение QVAC), сверхкомпактная VLM на ∼460M параметров: SigLIP2-вижн-энкодер + SmolLM2-360M-языковая основа, контекст 8192 токена, поддержка тайлинга изображений до 2048px; лицензия Apache 2.0; лучшая среди всех sub-0.5B…
Gemini Spark
Google, персональный AI-агент на базе Gemini 3.5/3.6, работающий 24/7 в фоне (даже при заблокированном экране или закрытом ноутбуке) на облачных виртуальных машинах Google; нативно интегрирован с Google Workspace (Gmail, Docs, Sheets, Calen…
Lyria 3.5
Google DeepMind, нейросеть для генерации музыки: улучшенная мелодичность (богатые, естественные переходы между секциями), более реалистичный вокал с эмоциональной экспрессией и точным произношением, гибкое управление темпом (BPM) и длительн…
📅 29.07
12 моделей
A.X K2
флагманская MoE-модель (Mixture of Experts) на 688B параметров (33B активных на токен) от SK Telecom, крупнейшая в суверенной AI-программе Южной Кореи; декодер-трансформер с 256 экспертами, контекст 262K токенов (расширяется до 512K через Y…
A.X K2 ALM
аудио-языковая модель (Audio Language Model) на 22B параметров от SK Telecom, предназначена для анализа голосовых звонков, консультаций и совещаний; способна распознавать и интерпретировать аудио из контакт-центров и производственных сред…
A.X K2 Raon-Speech
голосовая AI-модель на 21B параметров (3B активных), совместная разработка Krafton и SK Telecom для игровых AI-персонажей; комбинирует малую языковую модель A.X K2 с голосовым энкодером и кодеком Krafton для прямого понимания и генерации ре…
GPT Transcribe
модель распознавания речи от OpenAI для асинхронной транскрипции аудиофайлов и batch-нагрузок; работает в ~34 раза быстрее реального времени, Word Error Rate 3.31% (против 40.37% у Whisper на Common Voice), поддерживает контекстные подсказк…
GPT Live Transcribe
потоковая модель распознавания речи OpenAI для реального времени: живые субтитры, транскрипция звонков, микрофонный ввод; пониженная задержка по сравнению с GPT Transcribe, улучшенное понимание акцентов и технической терминологии в зашумлён…
Lyria 3.5
модель генерации музыки от Google DeepMind, запущена в Google Flow Music; улучшенная мелодичность, реалистичный вокал с эмоциональными нюансами, структурное понимание текстов песен (куплеты, припевы); пользователь управляет темпом (BPM) и д…
LFM2.5-Encoder-230M и LFM2.5-Encoder-350M
семейство bidirectional-энкодеров от Liquid AI на гибридной архитектуре LFM2 (gated convolution + grouped-query attention), адаптированных из decoder-моделей под понимание текста (MLM с 30% masking rate, контекст 8192 токена); на CPU при по…
Pangram 4
модель детекции AI-сгенерированного текста от Pangram Labs (Стэнфорд), построена на MoE-архитектуре (Mixture of Experts) со специализированными головами для детекции «очеловечивателей» (humanizer-обход), посегментного анализа и смешанного а…
Shieldstral
мультимодальный классификатор безопасности на 3B параметров от Mistral AI, формулирует модерацию контента как бинарный вопросно-ответный task; одна модель обрабатывает текст и изображения одновременно, политика модерации задаётся естественн…
MODUS
декодерная any-to-any-модель от EPFL VILAB (совместно с Apple, U. Copenhagen, CUHK и Lambda AI) для генерации 16 модальностей (RGB, глубина, нормали, сегментация, Canny-границы, SAM-маски, DINOv2/CLIP/ImageBind-фичи и др.) в едином causal-т…
GPT-Red
фреймворк автоматизированного red-teaming от OpenAI, использующий self-play (самоигру) для масштабного поиска уязвимостей языковых моделей; опубликован как исследовательская статья 29 июля с кодом; вместо ручного тестирования модель-атакующ…
Mage-VL
лёгкая потоковая multimodal-модель от Microsoft на 4B параметров для понимания видео: изображения, frame-сэмплированное видео, H.264/HEVC-видео и event-gated-стриминг; визуальный энкодер Mage-ViT (с нуля) + Qwen3-4B-Instruct как языковой ba…
📅 27.07
7 моделей
Kimi K3
Открытая MoE-модель (Mixture of Experts) на 2,8 трлн параметров (~50B активных, 896 экспертов с top-16 роутингом) от китайской Moonshot AI…
NVIDIA Cosmos-H-Dreams
Генеративный симулятор реального времени для хирургической робототехники от NVIDIA: causal-модель, дистиллированная из Cosmos-Predict2.5-2B методом self-forcing distillation…
MAI-Cyber-1-Flash
Первая специализированная кибербезопасная модель Microsoft: компактный дериватив MAI-Thinking-1 (~10× меньше GPT-5.4), заточенный под поиск, верификацию и исправление уязвимостей в коде…
Celeris-1
Диффузионная языковая модель от стартапа Celeris (основатели Tom Hamer и Jesse Clark — экс-Margo, backed by Lightspeed Venture Partners): генерирует текст не авторегрессивно, а параллельным уточнением «черновика» всего ответа за несколько п…
Claude Opus 5 (Anthropic)
выпущен 24 июля, широко освещался 27 июля, но не является релизом этой даты
Muse Spark 1.1 (Meta)
модель от 9 июля; развёртывание agentic-функций Meta AI стартовало 27 июля, но сама модель не новая
AgentENV (Kimi AI / kvcache-ai)
инфраструктура для agentic RL, а не AI-модель; опенсорснут 27 июля вместе с K3
📅 23.07
3 модели
Solar Open 2
открытая агентная LLM от Upstage (Южная Корея) в рамках госинициативы «суверенной модели»; MoE-архитектура (Mixture of Experts) на 250B параметров с 15B активных, оптимизирована под повторяющиеся рассуждения и вызовы инструментов…
Laguna S 2.1
компактная модель для агентного кодинга от Poolside; MoE на 118B параметров (8B активных), контекст до 1M токенов, режимы с рассуждениями и без…
FLUX 3
мультимодальная frontier-модель от Black Forest Labs (Германия): единая архитектура для изображений, видео и звука с возможностью предсказания действий для робототехники…
📅 22.07
4 модели
Solar Open 2 (Solar-Open2-250B)
открытая LLM от корейской Upstage: MoE-архитектура (Mixture of Experts) на 250B параметров с 15B активными, гибридное внимание (линейные слои + softmax, без позиционных кодировок NoPE) и контекст до 1M токенов; заточена под агентные задачи…
Antares-350M / Antares-1B
семейство компактных моделей (SLM, small language model) на 350M и 1B параметров от Cisco Foundation AI для локализации известных уязвимостей прямо в больших кодовых базах; работают on-prem без выгрузки исходников в облако, дают уровень GPT…
TimeLens2
мультимодальная LLM для универсального temporal grounding в видео (поиск нужных моментов по текстовому запросу) от лаборатории MCG-NJU (Нанкинский университет); код и веса открыты на GitHub, статья вышла в топ-1 трендовых на HuggingFace за…
Cursor Router
обученный командой Cursor классификатор уровня запроса (request-level classifier), который маршрутизирует каждый запрос к оптимальной модели по сложности и типу задачи, обеспечивая фронтир-качество кодинга при затратах на 30–50% ниже; закры…
📅 20.07
3 модели
NVIDIA Cosmos 3 Edge
открытая world-модель («модель мира») на 4B параметров от NVIDIA с двумя трансформерными «башнями» (авторегрессионная для reasoning + диффузионная для генерации действий); помогает роботам понимать окружение и генерировать до 32 действий за…
RynnBrain 1.1
embodied-модель (воплощённый ИИ) от Alibaba DAMO Academy и Hupan Lab в трёх размерах (2B, 9B и 122B-A10B) на базе Qwen3.5; decoder-only VLM (vision-language-модель) для пространственного reasoning, локализации объектов, планирования манипул…
Qwen-Audio-3.0-TTS
закрытая облачная TTS-модель (text-to-speech, синтез речи) от Alibaba Tongyi Lab в тирах Flash (~300мс задержка) и Plus (качество); поддержка 16 языков и 20 китайских диалектов, клонирование голоса и 86 тегов эмоций, доступ только через API…
📅 17.07
2 модели
Nemotron 3 Embed
семейство открытых эмбеддинг-моделей от NVIDIA (чекпоинты 8B и 1B, трансформер-энкодер с двунаправленным вниманием на базе Ministral, контекст 32K токенов, 34 языка) для RAG (генерация с поиском по базе), агентного и кодового поиска; 8B-вер…
ZUNA1.1
открытая foundation-модель для ЭЭГ (электроэнцефалографии) от Zyphra на 380M параметров; диффузионный автоэнкодер на трансформере с 4D-ротационным кодированием координат (x, y, z, t), принимает сигналы переменной длины 0.5–30 сек, восстанав…
📅 15.07
4 модели
Inkling
открытая (open-weight) мультимодальная MoE-модель (Mixture of Experts) от Thinking Machines Lab Миры Мурати: 975B параметров (41B активных), обучена на 45 трлн токенов текста/изображений/аудио/видео, контекст до 1M токенов, регулируемое «ус…
Inkling-Small
облегчённая версия флагмана Thinking Machines Lab: открытая мультимодальная MoE-модель на 276B параметров (12B активных), обучена по схожему рецепту; позиционируется как основа для дообучения через платформу Tinker (превью) (https://thinkin…
Bonsai 27B
открытая reasoning-модель для запуска на устройстве от PrismML (основана исследователями Caltech) на базе Qwen3.6-27B; экстремальная 1–1.58-битная квантизация ужимает 27B до ~3.9 ГБ и запускает модель локально на iPhone 17 Pro (~11 ток/с)…
Soofi S 30B-A3B
открытая суверенная двуязычная (немецкий/английский) foundation-модель немецкого консорциума Soofi (Fraunhofer IAIS, DFKI, TU Darmstadt): гибридная MoE-архитектура Mamba-Transformer, ~31.6B параметров (3.2B активных), контекст до 1M токенов…
📅 12.07
3 модели
NeuroVFM
нейровизуализационная foundation-модель от команды University of Michigan (публикация в Nature Medicine); vision-only self-supervised энкодер на 85.8M параметров (есть вариант 21.7M), обучен методом Vol-JEPA (расширение I-JEPA/V-JEPA на объ…
Vidu S1
модель интерактивной генерации видео в реальном времени от Tsinghua University и Shengshu AI; на базе диффузионных фреймворков TurboDiffusion/TurboServe…
DrugGen 2
disease-aware языковая модель для поиска лекарств от Isfahan University of Medical Sciences (Иран); дообученная GPT-2 с двухэтапным обучением (SFT на 13 908 парах болезнь-мишень-препарат + оптимизация GRPO)…
📅 11.07
1 модель
LingBot-VA 2.0
video-action (видео-действие) foundation-модель для универсального управления роботами-манипуляторами от Robbyant (подразделение embodied AI в составе Ant Group); causal Diffusion Transformer (диффузионный трансформер) на ~15.3B параметров…
📅 10.07
5 моделей
MuScriptor
от Kyutai и команды Mirelo; декодер-only Transformer в трёх размерах (103M / 307M / 1.4B параметров), транскрибирует многоинструментальную музыку из аудио (мел-спектрограмм) в MIDI…
OpenCoF
от ByteDance Seed; видео-модель, дообученная поверх Wan2.2-I2V-A14B с MoE-архитектурой (Mixture of Experts) и блоками DiT (Diffusion Transformer, ~14B параметров), реализует Chain-of-Frame рассуждения через генерацию видео…
SAM-MT
от Fudan University; расширение Segment Anything 2 для сегментации нескольких объектов в видео в реальном времени, использует раздельный masked-attention и query-based память; держит 36+ FPS на 10 целях там, где SAM2 падает до 12.4 FPS (htt…
DrugGen 2
от Isfahan University of Medical Sciences; языковая модель на базе GPT-2, дообученная через SFT и RL-метод GRPO (Group Relative Policy Optimization), генерирует молекулы-кандидаты по онтологии болезни и последовательности белка-мишени для d…
SensorFM
от Google Research; foundation-модель для носимых устройств на базе ViT-1D (одномерный Vision Transformer) с masked-autoencoder, до 110M+ параметров, обучена на 1 трлн минут сенсорных сигналов от 5 млн человек; решает 35 задач прогноза здор…
📅 09.07
8 моделей
GPT-5.6 Sol
флагманская закрытая reasoning-модель OpenAI, старшая в трёхуровневом семействе; заточена под сложный кодинг, кибербезопасность, науку и долгие агентные задачи, набирает 80 в Artificial Analysis Coding Agent Index (выше Claude Fable 5) и 91…
GPT-5.6 Terra
средняя сбалансированная модель OpenAI с производительностью на уровне GPT-5.5, но вдвое дешевле; универсальный «повседневный» вариант для агентов и автоматизации, поддерживает Programmatic Tool Calling (запуск JS-кода в изолированном V8)…
GPT-5.6 Luna
самая быстрая и дешёвая модель семейства OpenAI GPT-5.6, оптимизирована под высокую пропускную способность и объёмные нагрузки; даёт 84.3% на Terminal-Bench 2.1 при минимальной цене; закрытая, доступ через API ($1/$6 за 1M токенов) (https:/…
Grok 4.5
новая закрытая модель xAI класса Opus для кодинга и агентных задач с контекстом 500K токенов и встроенными серверными инструментами (веб-поиск, поиск по X, исполнение кода); #4 из 168 в Artificial Analysis Intelligence Index и лучший резуль…
Muse Spark 1.1
первая платная API-модель Meta Superintelligence Labs (уход от привычной open-weights стратегии Meta); мультимодальная reasoning-модель с контекстом 1M токенов, принимает текст, изображения, видео и документы, умеет tool use, автоматизацию…
Nemotron-Labs-3-Puzzle-75B-A9B
открытая гибридная MoE-модель (Mixture of Experts) от NVIDIA на 75.3B параметров (9.3B активных), архитектура из чередующихся Mamba-, MoE- и attention-блоков со сжатием от Nemotron-3-Super; даёт ~2× серверной пропускной способности и держит…
GPT-Live-1
новая полнодуплексная голосовая модель OpenAI, заменяющая Advanced Voice Mode; непрерывно слушает и говорит одновременно, много раз в секунду решая говорить/слушать/перебить/вызвать инструмент, для сложных запросов делегирует фоновой fronti…
GPT-Live-1 mini
облегчённая версия полнодуплексной голосовой модели OpenAI для бесплатного тарифа ChatGPT; та же архитектура естественного живого диалога (реакции «mhmm», паузы, перебивания), глобальный роллаут на iOS, Android и ChatGPT.com; бесплатно толь…
📅 07.07
3 модели
Cohere Transcribe Arabic
открытая модель распознавания речи (ASR) на 2B параметров от Cohere, заточена под арабский: диалекты, арабско-английский code-switching и спец-лексика; лицензия Apache 2.0, люди предпочли её Whisper в 95.8% тестов (WER 25.87 на HF Arabic AS…
Nemotron-Labs-Audex-30B-A3B (Audex)
унифицированная аудио-текстовая MoE-модель (MoE — Mixture of Experts, «смесь экспертов») от NVIDIA: 30B параметров, 3B активных, гибрид Mamba-Transformer, контекст 1M токенов; умеет ASR, перевод речи, TTS (text-to-speech), генерацию аудио и…
LingBot-Vision
открытая vision-модель (самообучаемый энкодер) от Robbyant (подразделение Ant Group) для плотного пространственного восприятия роботов; семейство ViT до 1.1B параметров, обучено на 161M изображений методом masked boundary modeling; в оценке…
📅 06.07
4 модели
Hy3
открытая языковая MoE-модель (Mixture of Experts) от Tencent Hunyuan: 295B параметров (21B активных), контекст 256K токенов, объединяет «быстрое» и «медленное» мышление с усиленными агентными возможностями; лицензия Apache 2.0, веса выложен…
Wan-Streamer v0.2
интерактивная real-time (в реальном времени) foundation-модель от Wan-AI (Alibaba): единый трансформер потоково обрабатывает текст, аудио и видео и на входе, и на выходе через block-causal attention для полнодуплексного аудио-визуального об…
GigaWorld-1
world-model (модель мира) от GigaAI: задаёт методику построения моделей мира для оценки политик роботов в embodied AI (воплощённом ИИ), выступая симулятором для тестирования действий робота без реального железа; код и материалы открыты (htt…
ZCode
облачный агент для кодинга от Zhipu AI (Z.ai) на базе модели GLM-5.2 с контекстом 1M токенов: умеет читать файлы, терминал и браузер, интегрируется с Git; работает только в облаке, бесплатный 5-дневный триал до 5M токенов в день (https://zc…
📅 03.07
1 модель
Leanstral 1.5
открытая MoE-модель (Mixture of Experts: 119B параметров, 6B активных, 128 экспертов, контекст 256K) от Mistral AI для формальной верификации и доказательства теорем в Lean 4; решает 587/672 задач PutnamBench, полностью «сатурирует» miniF2F…
📅 02.07
1 модель
diffusion-gemma-asr-small
открытая мультиязычная ASR-модель (распознавание речи) от стартапа Interfaze (Y Combinator); адаптер на ~42M параметров поверх замороженного диффузионного бэкбона DiffusionGemma-26B и энкодера Whisper-small, транскрибирует 6 языков (EN/DE/F…
📅 01.07
4 модели
Claude Sonnet 5
закрытая агентная LLM от Anthropic, ставшая 1 июля моделью по умолчанию для планов Free и Pro и доступная в Max/Team/Enterprise; умеет планировать, использовать инструменты (браузер, терминал) и работать автономно, показывая 63,2% на agenti…
ABot-M0.5
vision-language-action (VLA, «зрение-язык-действие») мировая модель действий от команды AMAP CVLab (Alibaba) для мобильных роботов-манипуляторов…
VideoSearch-R1
агентная модель поиска и рассуждений по видео от исследователей Korea University (группа Hyunwoo J. Kim); обучена через RL-алгоритм GRPO с «мягким» уточнением запроса в латентном пространстве вместо переписывания текста, ставит SOTA на бенч…
DART / Domain Arithmetic
метод одношаговой (one-shot) адаптации VLA-моделей к смене окружения (ракурс камеры, другой робот — с Panda на UR5e) через арифметику весов и выравнивание сингулярных подпространств; от Taewook Kang и соавторов, превосходит существующие мет…
Июнь
2026
📅 27.06
1 модель
DeepSeek-V4-DSpark (Pro / Flash)
открытые ускоренные чекпоинты от DeepSeek AI на базе DeepSeek-V4: MoE-архитектура (Mixture of Experts) на 1.6T параметров (49B активных) с гибридным вниманием и контекстом 1M токенов…
📅 26.06
3 модели
GPT-5.6 Sol
закрытая флагманская мультимодальная модель OpenAI с новым уровнем reasoning-усилия «max» и режимом «ultra» (использует суб-агентов для сложных задач); доступ только через API в ограниченном превью (~20 организаций, по согласованию с правит…
GPT-5.6 Terra
сбалансированная закрытая модель OpenAI для повседневной работы: сопоставима по качеству с GPT-5.5, но примерно вдвое дешевле; API only, цена $2.50 / $15 за 1M токенов, старт в ограниченном превью с поэтапным расширением доступа (https://he…
GPT-5.6 Luna
самая быстрая и дешёвая модель линейки GPT-5.6 от OpenAI, рассчитана на высокообъёмные рутинные задачи; закрытый API, цена $1 / $6 за 1M токенов вход/выход, доступна пока только избранным партнёрам превью (https://help.openai.com/en/article…
📅 25.06
4 модели
Ornith-1.0
семейство открытых моделей для кодинга от DeepReinforce в четырёх размерах (9B и 31B dense, а также 35B и 397B на MoE-архитектуре (Mixture of Experts), ~3B активных у 35B); построено поверх Gemma 4 и Qwen 3.5, выдаёт reasoning в <think>-бло…
Gemini 3.5 Flash (Computer Use)
Google встроила управление компьютером напрямую в Gemini 3.5 Flash: модель видит экран и сама работает с браузером, ПК и мобильными устройствами для автотестов и офисной автоматизации…
ViQ
визуальный токенизатор от Tencent HY Vision Team (с Tsinghua, NTU, CAS) на 1.3B параметров на базе SigLIP2-g, преобразующий изображения любого разрешения в дискретные коды с сохранением семантики и качества реконструкции…
Qwen-Image-Agent
агентский фреймворк для генерации изображений от Alibaba Qwen: training-free, совместим с существующими генераторами, добавляет планирование, reasoning, веб/картиночный поиск и память для multi-image и multi-turn сценариев…
📅 23.06
4 модели
lift
открытая vision-модель на 9B параметров от Datalab для извлечения структурированного JSON из PDF и изображений по заданной JSON-схеме; использует schema-constrained decoding (декодирование с ограничением по грамматике), гарантирующее валидн…
OpenThoughts-Agent
открытые агентные модели на 8B и 32B параметров, дообученные от Qwen3 командой OpenThoughts (коллаборация институтов); натренированы по data-рецептам для агентных задач (исправление кода/SWE, работа с инструментами, терминал)…
Mistral OCR 4
закрытая модель document intelligence от Mistral AI; распознаёт документы (PDF, DOC, PPT, OpenDocument) на 170 языках, выдаёт структурированный JSON с bounding-box, классификацией блоков и оценками уверенности для RAG и enterprise-поиска…
Doubao 2.1 Pro
закрытая флагманская LLM от ByteDance, представленная на конференции Volcano Engine FORCE; крупное обновление с упором на кодинг, агентные сценарии и vision-language-понимание…
📅 22.06
3 модели
Sakana Fugu
оркестрационная модель от японской Sakana AI: 7B-«дирижёр», который сам маршрутизирует подзадачи по пулу фронтир-LLM через OpenAI-совместимый API; основана на работах TRINITY и Conductor (ICLR 2026)…
Sakana Fugu Ultra
усиленный вариант того же оркестратора, настроенный на максимальную точность в сложных многошаговых задачах (кодинг, рассуждения, наука); по заявлению Sakana, сравнивается с Claude Fable 5 и Mythos, не обучая ни одной собственной фронтир-мо…
gemma-4-12B-it-abliterix
abliterated (расцензуренная) дообученная версия Google Gemma 4 12B от автора wangzhang; dense-трансформер на 12B параметров в формате BF16 safetensors со снятым «выравниванием-отказом» для локального запуска…
📅 18.06
5 моделей
Sumi
открытая диффузионная языковая модель (Diffusion LM, uniform diffusion) на 7B параметров от Tohoku University; bidirectional Transformer на 36 слоёв, обучена на 1.5T токенов по фреймворку GIDD, полностью открыты веса, чекпойнты и рецепт обу…
PerceptionDLM
мультимодальная диффузионная языковая модель (Diffusion LM) на 9B от MSALab/PKU для одновременного описания нескольких областей изображения (image-text-to-text); генерирует подписи ко всем регионам за один проход денойзинга с ускорением до…
Moebius
сверхлёгкая диффузионная модель инпейнтинга изображений на 0.22B от Huazhong University of Science and Technology и VIVO AI Lab; латентный U-Net с блоками LλMI, латентность 26 мс/шаг и качество на уровне 10B-моделей (FLUX.1-Fill) при менее…
FreeStyle
диффузионный фреймворк генерации text-to-image с раздельными референсами стиля и контента от Fudan University, построен на майнинге community LoRA; сохраняет структуру и семантику контента, перенося стиль другого изображения; открыты веса…
S-Agent-8B
vision-language агент для пространственного рассуждения (spatial reasoning) от NTU, THU и ByteDance; VLM на 8B, дообученный из Qwen3-VL-8B на датасете S-300K, координирует иерархические 2D- и 3D-инструменты для подсчёта объектов, измерения…
📅 17.06
2 модели
MolmoMotion
открытая модель Ai2 (Allen Institute for AI) для language-guided 3D motion forecasting (предсказание 3D-траекторий точек по видеокадру и текстовой инструкции); использует Molmo 2 в качестве VLM-бэкбона, выложены веса, датасет MolmoMotion-1M…
MiniMax-M3 (технический отчёт MSA)
MiniMax опубликовал технический отчёт и inference-кёрнел архитектуры MSA (MiniMax Sparse Attention) под MIT-лицензией; натиивно мультимодальная MoE-модель на ~428B параметров (~23B активных) с 1M-контекстом, двухветвевая блочно-разреженная…
📅 16.06
4 модели
GLM-5.2
флагманская MoE-модель (Mixture of Experts) от Zhipu AI на 744B параметров (40B активных) с контекстом 1M токенов, ориентирована на длинные траектории кодинг-агентов; открытые веса под лицензией MIT, доступна через API ZAI/Novita/FriendliAI…
Qwen-RobotManip
VLA-модель (vision-language-action) от Alibaba Qwen на бэкбоне Qwen3.5-4B для манипуляции объектами роботизированными руками; обучена на 38 100+ часах данных манипуляции, код опубликован на GitHub в составе сюиты Qwen-RobotSuite (https://qw…
Qwen-RobotNav
навигационная VLA-модель от Alibaba Qwen на основе Qwen3-VL (варианты 2B/4B/8B), объединяющая следование инструкциям, point/target navigation и трекинг объектов; обучена на 15.6M примеров, latency 196 мс на Unitree Go2 с Jetson Thor (https:…
Qwen-RobotWorld
видео-«мировая модель» от Alibaba Qwen для предсказания будущих кадров сцены до действия робота; 60-слойная двухпоточная MMDiT-архитектура с замороженным энкодером Qwen2.5-VL на 20B параметров, опубликована в составе Qwen-RobotSuite (https:…
📅 13.06
2 модели
GLM-5.2
флагманская MoE-модель (Mixture of Experts) от Zhipu AI / Z.ai на 744B параметров (40B активных) с контекстом 1M токенов; 13 июня запущена на всех платных тарифах GLM Coding Plan (Lite / Pro / Max / Team), заточена под агентское программиро…
Count Anything
vision-модель подсчёта объектов по текстовому запросу от исследователей Tsinghua University (Mengqi Lei и соавторы); построена поверх Meta SAM3 с двумя счётчиками (Region-level Sparse Counter для крупных объектов, Pixel-level Dense Counter…
📅 12.06
3 модели
Kimi K2.7 Code
открытая coding-модель от Moonshot AI с MoE-архитектурой (Mixture of Experts): 1 триллион параметров всего, 32B активных, 384 эксперта, контекст 256K; заточена на длинные agentic-задачи в инженерии ПО, лицензия Modified MIT, веса на Hugging…
Zamba2-VL
семейство открытых vision-language моделей от Zyphra на 1.2B / 2.7B / 7B параметров с гибридной архитектурой Mamba2 (state-space) + Transformer; снижает time-to-first-token примерно на порядок против обычных VLM, лицензия Apache 2.0 (https:…
Gemini-SQL2
закрытая text-to-SQL модель Google Research поверх Gemini 3.1 Pro, переводит естественный язык в исполняемые SQL-запросы; первая система, преодолевшая 80% на бенчмарке BIRD (80.04%), без fine-tuning, рассчитана на интеграцию в BigQuery (htt…
📅 10.06
5 моделей
DiffusionGemma 26B-A4B
открытая MoE-модель (Mixture of Experts) от Google DeepMind на базе Gemma 4: 26B параметров (3.8B активных), диффузионная генерация текста параллельно вместо токен-за-токеном, контекст 256K, 140+ языков, Apache 2.0, ~1100 ток/с на H100 (htt…
Gemini 3.5 Live Translate
закрытая мультимодальная аудио-модель Google для синхронного голосового перевода с автоопределением языка на 70+ языков, доступ через Gemini API и приложение Gemini (https://blog.google/innovation-and-ai/models-and-research/gemini-models/ge…
i1
text-to-image (T2I) диффузионная модель на 3B параметров от Принстона, полностью открытый рецепт (веса, код и данные публичны), обучена на 300+ контролируемых экспериментах и конкурирует с проприетарными системами при тренировке только на п…
InternVideo3
мультимодальная видео-foundation модель от Shanghai AI Lab с архитектурой Multimodal Multi-head Latent Attention (M²LA) для длинного видео-контекста; вводит парадигму Multimodal Contextual Reasoning (MCR) и показывает SOTA на Video-MME, MLV…
DeNovoSWE-Agent
code-агент для генерации целых репозиториев из документации, fine-tuned на Qwen3-30B-A3B и Qwen3.5-35B-A3B; поднимает результат на BeyondSWE-Doc2Repo с 5.8% до 47.2%, датасет на 4818 инстансов и код открыты (https://huggingface.co/collectio…
📅 09.06
5 моделей
Claude Fable 5
закрытая флагманская модель Mythos-класса от Anthropic для самых сложных задач кодинга, vision и научных исследований; доступна через Claude API и Enterprise-планы по цене $10/$50 за 1M входных/выходных токенов (https://www.anthropic.com/ne…
Claude Mythos 5
та же базовая модель, что и Fable 5, но со снятыми защитными ограничениями; доступна узкой группе кибердефендеров и инфраструктурных провайдеров через Project Glasswing, цена та же ($10/$50 за 1M токенов) (https://www.anthropic.com/news/cla…
North Mini Code
открытая агентная coding-модель от Cohere на MoE-архитектуре (Mixture of Experts), 30B параметров (3B активных), контекст 256K и выход 64K; лицензия Apache 2.0, веса на HuggingFace, на Coding Index обгоняет Devstral Small 2 в 2.8× по throug…
Gemini 3.5 Live Translate
закрытая стриминговая speech-to-speech audio-модель от Google DeepMind для синхронного перевода между 70+ языками с сохранением тона и темпа; доступна в public preview через Gemini Live API и Google AI Studio, частный preview в Google Meet…
ABot-Earth 0.5
генеративная 3D-модель Земли от Alibaba AMap CV Lab, по одному спутниковому снимку или текстовому промту строит километровую городскую сцену в формате 3D Gaussian Splatting за ~10 минут на потребительском GPU; код открыт на GitHub, paper оп…
📅 08.06
4 модели
Xiaomi MiMo-V2.5-Pro-UltraSpeed
релиз Xiaomi совместно с TileRT: триллион-параметрическая MoE-модель (Mixture of Experts) с FP4-квантизацией и DFlash speculative decoding, преодолевшая отметку 1000+ токенов/с на стандартной 8-GPU-ноде; чекпойнт FP4-DFlash открыт на Huggin…
Nex-N2-Pro
агентная MoE-модель от Nex AGI на 397B параметров (17B активных) на базе Qwen3.5, мультимодальная (image-text-to-text), контекст 262K, лицензия Apache 2.0; 75.3 на Terminal-Bench 2.1 и 1585 на GDPval, конкурирует с GPT-5.5 и Claude Opus 4.7…
Nex-N2-Pro (free)
бесплатный облачный доступ к Nex-N2-Pro через OpenRouter с поддержкой reasoning, function calling и structured outputs, оптимизирован для кодинга, deep research и долгогоризонтных агентных задач (https://openrouter.ai/nex-agi/nex-n2-pro:fre…
Apple Siri (Gemini-powered)
обновлённый Siri от Apple, представленный на WWDC 2026: работает на кастомной 1.2T-параметрической модели Google Gemini в Private Cloud Compute, поддерживает on-screen awareness, persona context и Extensions (выбор ChatGPT/Gemini/Claude) (h…
📅 05.06
5 моделей
Gemma 4 E2B QAT
открытая мультимодальная (текст/изображение/аудио) модель от Google DeepMind, 2.3B эффективных параметров, 128K контекст; квантизация Q4_0 ужимает её до 3.2 ГБ, а новый мобильный формат — до ~1 ГБ для запуска на смартфонах, лицензия Gemma (…
Gemma 4 E4B QAT mobile
edge-вариант Gemma 4 на 4B параметров с мобильно-оптимизированным форматом (статические активации, channel-wise квантизация, 2-bit таргетное сжатие), занимает 5 ГБ в Q4_0 против 15 ГБ в BF16; готов к запуску через LiteRT-LM и MLX (https://h…
Gemma 4 12B QAT
instruction-tuned dense-модель Google на 12B параметров с QAT-квантизацией w4a16, рассчитана на потребительские GPU; поддерживает llama.cpp, Ollama, LM Studio, vLLM, лицензия Gemma (https://huggingface.co/google/gemma-4-12B-it-qat-w4a16-ct)
Gemma 4 26B-A4B QAT
MoE-архитектура (Mixture of Experts) Google DeepMind с 26B всего и 4B активных параметров на токен, QAT Q4_0 чекпойнт для эффективного локального инференса с компенсацией потерь точности на этапе обучения (https://huggingface.co/google/gemm…
Gemini Enterprise Agentic RAG
закрытая enterprise-система Google Research на базе Gemini для надёжного retrieval-augmented generation в корпоративных агентах; доступ только через Gemini Enterprise Agent Platform, без открытых весов (https://research.google/blog/unlockin…
📅 04.06
3 модели
Nemotron 3 Ultra
флагманская открытая модель NVIDIA на 550B параметров (55B активных) с гибридной MoE-архитектурой (Mixture of Experts) Mamba-Transformer, 108 слоёв и 512 экспертов; контекст 1M токенов, лицензия NVIDIA Open Model License, заточена под долго…
Nemotron 3.5 Content Safety
мультимодальный классификатор безопасности от NVIDIA на 4B параметров поверх Gemma 3 4B IT с LoRA-адаптерами и контекстом 128K; оценивает текст, изображения и ответы ассистента, поддерживает 12 языков нативно и ~140 в zero-shot, лицензия NV…
Grok Imagine Video 1.5
закрытая image-to-video модель xAI: анимирует статичные изображения в короткие ролики до 720p с сохранением освещения и деталей; управляется текстовыми промтами для камеры и темпа, доступна только в preview через xAI API (https://x.ai/news/…
📅 03.06
4 модели
Gemma 4 12B
открытая мультимодальная модель Google DeepMind на 12B параметров без визуального энкодера, нативно обрабатывает текст, изображения и аудио…
Cosmos 3
семейство foundation-моделей мира от NVIDIA в двух вариантах: Nano 16B (бэкбон Qwen3-VL 8B) и Super 64B (бэкбон Qwen3-VL 32B), архитектура two-tower MoT (Mixture of Transformers)…
Ideogram 4.0
открытая (open-weight) text-to-image (T2I) модель от Ideogram с нативным 2K-разрешением, bounding-box контролем размещения объектов и заметно улучшенным рендерингом текста…
Cosmos 3 paper
статья NVIDIA «Cosmos 3: Omnimodal World Models for Physical AI» на HuggingFace Papers, описывающая two-tower MoT-архитектуру и протоколы обучения для омнимодальных моделей мира; набрала ~8.7K апвоутов за день (https://huggingface.co/papers…
📅 02.06
6 моделей
MAI-Thinking-1
первая собственная reasoning-модель Microsoft: разреженная MoE-архитектура (Mixture of Experts) на ~1T параметров (35B активных) с контекстом 256K, обучена без дистилляции чужих моделей; сильна в математике (AIME 2026 — 94.5%) и кодинге, до…
MAI-Code-1-Flash
компактная кодинг-модель Microsoft на 5B параметров с адаптивным «мышлением» (экономит до 60% токенов на сложных задачах); закрытые веса, доступна в GitHub Copilot включая бесплатный тариф, по цене/качеству обходит Claude Haiku 4.5 (https:/…
MAI-Image-2.5
обновлённая модель Microsoft для генерации и редактирования изображений (text-to-image + image-to-image) с функциями «контроль с сохранением» деталей; дебютировала на 3-м месте Arena.ai среди image-моделей, доступ только через API в Microso…
MAI-Voice-2
многоязычная TTS-модель Microsoft (text-to-speech) с клонированием голоса и voice-prompting для более чем 15 языков, единый голос сохраняет идентичность между языками; закрытая, поставляется через Foundry и продукты Copilot/Bing (https://te…
MAI-Transcribe-1.5
модель распознавания речи (speech-to-text) от Microsoft на MoE-архитектуре, поддержка 43 языков и контекстного смещения терминологии; примерно в 5× быстрее конкурентов при цене $0.36/час, доступна только в облаке через Foundry (https://tech…
Holo3.1
семейство быстрых computer-use агентов (управление GUI на вебе, десктопе и мобильных) от H company в размерах 0.8B/4B/9B и 35B-A3B (MoE); открытые веса на HuggingFace с квантизациями FP8/NVFP4/Q4 GGUF для локального запуска, 79.3% на Androi…
📅 01.06
4 модели
MiniMax M3
открытая мультимодальная LLM от китайской MiniMax на разреженном внимании MSA (MiniMax Sparse Attention) с контекстом 1M токенов; нативно понимает изображения и видео, управляет компьютером и силён в агентном кодинге (59% SWE-Bench Pro, 70%…
Mellum2
компактная MoE-модель (Mixture of Experts) на 12B параметров (2.5B активных) от JetBrains для текста и кода; более чем в 2 раза быстрее моделей своего класса, заточена под маршрутизацию, RAG и саб-агентов, лицензия Apache 2.0 (https://huggi…
NVIDIA Cosmos 3
открытая omni-модель для физического ИИ от NVIDIA на архитектуре Mixture-of-Transformers; в едином трансформере объединяет генерацию мира, физический reasoning и генерацию действий (текст/изображение/видео/аудио/действия), версии Nano 16B и…
Nemotron 3 Ultra
открытая (open-weight) MoE-модель от NVIDIA на ~550B параметров (~55B активных), анонсирована 1 июня (выкладка весов 4 июня); сильнейшая открытая модель из США по Artificial Analysis (48 баллов) и >300 токенов/с на DeepInfra (https://the-de…
Май
2026
📅 29.05
5 моделей
Step 3.7 Flash
открытая vision-language MoE-модель (MoE — Mixture of Experts, разреженная архитектура экспертов) на 198B параметров (~11B активных) с контекстом 256k от StepFun; ориентирована на агентов для кодинга и веб-поиска (56,26% на SWE-Bench Pro)…
Qwen-VLA
vision-language-action модель (зрение-язык-действие) от Alibaba Qwen для управления роботами разных конфигураций; использует DiT-декодер действий (Diffusion Transformer) и единый фреймворк для манипуляций и навигации, 97,9% на бенчмарке LIB…
minWM
открытый full-stack фреймворк от ShengShu и университетов Tsinghua/RUC для real-time интерактивных видео-world-моделей; дистиллирует диффузионные бэкбоны Wan2.1-1.3B и HY1.5-8B в few-step (малошаговые) авторегрессионные генераторы, ускоряя…
NAVA
модель на 6.3B параметров от ERNIE Team (Baidu) для совместной генерации аудио и видео; архитектура Align-then-Fuse MMDiT обеспечивает точную аудио-видео синхронизацию и управляемый тембр речи, веса и код открыты на HuggingFace (https://hug…
GPT-Rosalind
закрытая облачная модель OpenAI для наук о жизни (рассуждения о молекулах, белках, генах, биологии болезней); 29 мая OpenAI расширила бесплатный доступ через программу Rosalind Biodefense для проверенных команд и госпартнёров (вакцины, скри…
📅 28.05
10 моделей
RightNow-Arabic-0.5B-Turbo
арабоязычная LLM на 518M параметров на базе Qwen2.5-0.5B, полные веса (bf16/int8/GGUF), код и бенчмарки выложены на Hugging Face (arXiv cs.CL)
Liquid AI LFM2.5-8B-A1B
MoE-модель с 8.3B общих и 1.5B активных параметров, оптимизирована для on-device-инференса
Perplexity Unigram Tokenizer
переписанный с нуля open-source токенизатор, снижает латентность реранкеров и CPU-нагрузку в 5–6×
minWM
полностековый open-source фреймворк для интерактивных видео-«world models» в реальном времени
Qwen-VLA
унифицированная vision-language-action модель от команды Qwen для роботов и разных окружений
MOSS-TTS
открытое семейство моделей для генерации речи и звуков, включая диалоги и звуковые эффекты
Parallax
параметризованное локальное линейное внимание для языкового моделирования от Northwestern University
GenClaw
code-driven агентная генерация изображений от Tencent Hunyuan
LiteCoder-Terminal
масштабирование long-horizon terminal-окружений для обучения языковых агентов
PhoneWorld
масштабируемая среда для агентов, использующих смартфон
📅 27.05
15 моделей
DiffusionBlocks
фреймворк блочного обучения от Sakana AI, превращает остаточные сети в независимо обучаемые денойзинг-модули
Polar
NVIDIA выпустила token-faithful rollout-фреймворк для GRPO-тренировки поверх Codex, Claude Code и Qwen Code
EAGLE 3.1
алгоритм спекулятивного декодинга, борющийся с attention drift; совместный релиз EAGLE team, vLLM и TorchSpec
Gamma-World
генеративная модель мульти-агентного мира от NVIDIA, выходящая за рамки игр на двух игроков
From Pixels to Words
натив-визуальная модель на масштабе с архитектурой one-vision
Agent Explorative Policy Optimization
NVIDIA, оптимизация политики для мультимодального агентного рассуждения
OSP-Next
эффективная высококачественная модель генерации видео от Peking University
HRBench
Tencent, бенчмарк стратегий переключения режимов мышления в гибридно-рассуждающих LLM
OmniVerifier-M1
мультимодальный мета-верификатор со структурированной рекалибровкой
ResearchMath-14K
Seoul National University, агентное масштабирование математики исследовательского уровня
Self-Improving LM with Bidirectional Evolutionary Search
Harvard, самоулучшающиеся языковые модели через двунаправленный эволюционный поиск
AutoScientists
Harvard, самоорганизующиеся команды агентов для научных экспериментов
ITBench-AA
IBM × Artificial Analysis, первый бенчмарк для агентных задач корпоративного IT (фронтир-модели набирают <50%)
Reachy Mini goes fully local
open-source стек локального голосового робота от Pollen Robotics / Hugging Face
FLUID
фреймворк адаптации AR-бэкбонов к диффузионным моделям для параллельной генерации текста (arXiv cs.CL)
📅 26.05
10 моделей
OmniVoice Studio
локальная open-source альтернатива ElevenLabs: клонирование голоса, дубляж видео, диктовка и диаризация спикеров, поддержка 646 языков и встроенный MCP-сервер
Stable Audio 3
семейство быстрых latent-diffusion моделей для генерации и редактирования аудио (Small SFX 459M, Small 459M, Medium 1.4B с открытыми весами); генерация композиций до 6 мин 20 сек
LocateAnything
модель NVIDIA для vision-language grounding с параллельным декодированием bounding-боксов
MobileMoE
оптимизированная on-device Mixture-of-Experts модель от Meta AI для запуска на мобильных устройствах
MUSE-Autoskill
фреймворк самоэволюционирующих агентов ByteDance с автономным созданием навыков, памятью и оценкой
RT-Lynx
диффузионная модель от RTP-LLM с правильной GEMM-разрежённостью для ускорения инференса
MRT (Masked Region Transformer)
трансформер для послойной генерации и редактирования изображений в большом масштабе
Soap2Soap
мультиагентная система Show Lab для пересборки длинных кинематографических видео
Geometry-Aware Representation Denoising
модель KAIST AI для устойчивой multi-view 3D-реконструкции через денойзинг геометрических представлений
Squeezing Capacity from MLLMs
методы Adobe для эффективной subject-driven генерации на базе мультимодальных LLM
📅 25.05
6 моделей
Raon-Speech
9B-параметровая речевая языковая модель для английского и корейского с публичными чекпоинтами и обучающим пайплайном (arxiv cs.CL)
QUEST
семейство открытых моделей 2B–35B в роли универсальных агентов для глубоких исследований; выложены веса, данные и скрипты обучения (arxiv cs.CL)
EchoDistill
open-source фреймворк выравнивания для аудио-LLM, повышающий устойчивость к шуму; код в анонимном репозитории (arxiv cs.CL)
ContextEcho
открытый бенчмарк и харнесс для измерения дрейфа персоны в длинных агентских сессиях кодинга (arxiv cs.CL)
CP-Agent
агент с калиброванным контролем риска для соревновательного программирования; код на GitHub (arxiv cs.CL)
OSCAR
attention-aware система 2-битной квантизации KV-кэша для long-context инференса LLM от Together AI (together.ai)
📅 24.05
2 модели
Gated DeltaNet-2
новый слой линейного внимания от NVIDIA AI, разделяющий «стирание» и «запись» в Delta Rule через отдельные канальные гейты; на 1.3B параметрах и 100B токенах обгоняет конкурентов в…
Webwright
терминальный browser-agent фреймворк от Microsoft Research, заменяющий click-trace веб-автоматизацию переиспользуемыми Playwright-скриптами; 60.1% на Odysseys и 86.7% на Online-Min…
📅 23.05
4 модели
Nemotron-Labs Diffusion
диффузионные языковые модели NVIDIA с генерацией текста «на скорости света»
TencentDB Agent Memory
четырёхуровневая локальная система памяти для AI-агентов от Tencent
Contrastive Neuron Attribution (CNA)
метод от Nous Research для управления MLP-цепями без SAE-обучения и модификации весов
Bumblebee
read-only сканер цепочки поставок для разработчиков от Perplexity
📅 22.05
3 модели
Microsoft Fara1.5
семейство open-weight браузерных computer-use агентов (4B/9B/27B на базе дообученной Qwen 3.5); 27B-версия даёт 72% на Online-Mind2Web, опережая OpenAI Operator и Gemini 2.5 Comput…
OpenMythos
открытый фреймворк для построения recurrent-depth трансформеров с поддержкой MLA, GQA, Sparse MoE и loop-scaled reasoning
Models.dev
открытая база спецификаций, цен и возможностей AI-моделей (Hacker News / YC)
📅 17.05
7 моделей
X-OmniClaw (Oppo Multi-X)
открытый Android AI-агент, работающий прямо на устройстве: использует камеру, экран и голос для выполнения задач в реальных приложениях без облачного клона телефона; запоминает цеп…
Solvita
агентный фреймворк непрерывного обучения для соревновательного программирования; 4 специализированных агента (Planner, Solver, Oracle, Hacker) накапливают опыт без изменения весов…
ICRL
фреймворк RL для интернализации самокритики языковой моделью; построен на Qwen3-4B/8B, код открыт (arXiv cs.AI)
SMCEvolve
метод поиска программ на основе Sequential Monte Carlo: задача переформулируется как сэмплирование из reward-tilted распределений; ориентирован на научные открытия, код открыт (arX…
SkillSmith
компилятор и рантайм для упаковки навыков агентов в минимальные исполняемые интерфейсы; исходный код и данные опубликованы на GitHub (arXiv cs.AI)
OP-Mix
алгоритм смешивания данных для тренировки LLM на всём жизненном цикле через low-rank адаптеры, обученные на текущей модели; устраняет необходимость в прокси-моделях (arXiv cs.CL)
Parallel Speculative Decoding (PSD)
фреймворк без дообучения для ускорения инференса диффузионных LLM через адаптивные политики размаскирования (arXiv cs.CL)
📅 15.05
3 модели
Supertonic v3
лёгкая on-device TTS-модель (~99M параметров, ONNX) с поддержкой 31 языка, тегами эмоций (<laugh>, <breath>, <sigh>) и сниженным числом ошибок чтения
ZAYA1-8B-Diffusion-Preview
первая MoE diffusion-модель от Zyphra, сконвертированная из авторегрессионного LLM, с ускорением до 7.7× при генерации
VectraYX-Nano
41.95M decoder-only LLM для испаноязычной кибербезопасности с нативной интеграцией MCP; опубликованы корпус, скрипты обучения и GGUF-веса (arXiv cs.CL, 2605.13989)
📅 13.05
7 моделей
GLiGuard
энкодерная safety/guardrail-модель на 300M параметров от Fastino Labs (детекция джейлбрейков, классификация вреда и отказы за один проход), лицензия Apache 2.0, опубликована на Hug…
Voxtral TTS
мультиязычная TTS-модель на 4B параметров от Mistral, архитектура Autoregressive + Flow-Matching, синтез 24 kHz (WAV/MP3/FLAC), лицензия CC BY-NC 4.0
Qwen-Image-VAE-2.0
технический отчёт от команды Qwen (Alibaba) о новой архитектуре image VAE, сопровождается публикацией модели
AnyFlow
any-step видео-диффузионная модель от NVIDIA с on-policy flow map distillation
PresentAgent-2
мультимодальный агент общего назначения для генерации презентаций от Peking University
DavidAU/Marco-Nano-Thinking-8B-A0.6B
компактная reasoning-модель на 8B параметров
OpenHuman
Rust-проект персонального приватного AI-суперинтеллекта, +1696 звёзд за день
📅 09.05
2 модели
NVIDIA Star Elastic
единый чекпойнт, содержащий вложенные ризонинг-модели на 30B/23B/12B с zero-shot «нарезкой» размера без дообучения; вариант 23B→30B даёт до +16% точности и 1.9× меньшую задержку
OncoAgent
open-source двухуровневый мульти-агентный фреймворк для приватного клинического принятия решений в онкологии
📅 08.05
2 модели
EMO (Allen AI)
MoE-модель с эмерджентной модульностью, 1B активных / 14B общих параметров, 128 экспертов, обучена на 1T токенов; веса, код и статья открыты
CyberSecQwen-4B
специализированная 4B-модель на базе Qwen3-4B-Instruct для оборонительной кибербезопасности (CWE/CVE-классификация, threat intel), Apache 2.0, запускается на 12 ГБ GPU