charts · trends
📨 Recent posts
21 totalGemma 4 blogpost | model card | huggingface 4 размера: E2B, E4b (бывшие Gemma 3n/Gemini Nano); 26A4B, 31B Dense. Теперь лицензия Apache 2.0! Для всех моделей релизим претрейн и intruction tuned чекпойнты. Context length 256k у 31B модельки, 128k у остальных.…
Мечта всех, кто хотел кожаночку как у Дженсена Хуанга – на следующем Sotheby's можно будет купить подписанную им куртку Tom Ford . Средства пойдут на благотворительность, ориентировочная цена – 40-60k$, хотя зачастую у аукционных домов не всё хорошо с оценкой спроса, и куртка может уйти за сильно больше какому-нибудь сотруднику фронтирной лабы. Если кто-то из дорогих подпищеков купит – маякните 😎
Пока я откисаю в Корее от очередного сезона исхода дорогих коллег [ 1 , 2 , 3 , и др.] перед ICML , наша с читателями любимая Лилиан Вэн – авторка топ-1 блога по диплёрнингу – написала первый за почти два года пост про историю и развитие науки об оценке правил масштабирования ( scaling laws ) языковых моделей. Почему "правил", а не "законов" – чтобы не создавать ощущения универсальности самих зак…
Проверяемся, запомнили ли вас ллмки на intheweights.com Гпт 5.5 меня задизреспектила 😭
MTP спекулятивный декодинг в Gemma 4 : ускоряемся в два раза без потери качества 🥳 В нашу дорогую гемму наконец завезли спекулятивный декодинг, когда более маленькая модель предсказывает токены, которые могут верифицироваться большой моделью параллельно, существенно ускоряя инференс для локальных юзкейзов. Попробовать можно через HuggingFace transformers, остальные движки тоже скоро будут поддерж…
Продолжаем геммапропаганду. В прошлом году у NVIDIA вышла неплохая статья о том, как ловить людей, которые доливают тест в трейн. CoDeC – нормализованный показатель перплексии, где для тестсета бенчмарка считают изменения в перплексии с дополнительными примерами из того же бенчмарка. Для неконтаминированных моделек мы ожидаем, что дополнительные примеры не будут сбивать модель с толку, а в лучшем…
WeirdML – один из самых необычных бенчмарков для ЛЛМок. В него входят необычные open-ended задачки по МЛю, например, написание МЛ пайплайнов по распознаванию цифр со всего 28 размеченными примерами и ~50к неразмеченными, предсказание формы фигур, или восстановление перемешанных фрагментов изображений. Gemma 4 31B оказалась самой сильной открытой моделью на этом бенчмарке, опередив GLM 5 (MoE на 7…
Мои любимые artificial analysis выложили своё независимое тестирование Gemma 4 ( твит , страница с результатами ), по результатам вышло хуже квенов из-за просадки на 𝜏²-bench, ну и ладно с ним. На картинку с бенчмарками можно позалипать в комментариях к посту. В этой версии мне довелось поработать над околонаучными бенчмарками и работой с длинным контекстом, а там мы наступаем на пятки китайским…
Gemma 4 blogpost | model card | huggingface 4 размера: E2B, E4b (бывшие Gemma 3n/Gemini Nano); 26A4B, 31B Dense. Теперь лицензия Apache 2.0! Для всех моделей релизим претрейн и intruction tuned чекпойнты. Context length 256k у 31B модельки, 128k у остальных. Скажу по секрету – можно пробовать и больше, должно работать. LLM Arena на уровне Kimi 2.5, бенчмарки можно посмотреть на huggingface
Gemini embedding 002 блог | API docs Первые по-настоящему мультимодальный эмбеддинги от нас. Теперь можно за в один эмбеддинг загнать до 8к токенов текста, 6 картинок, 120 секунд видео, 80 секунд аудио или 6 страниц PDF. Цены почти не изменилась – с $0.15/MTok до $.20/MTok, для batch использования – вдвое дешевле. В этой версии сильно улучшили качество эмбеддингов по коду, теперь распознаёт больш…
Artificial analysis (они зайки, делают лучшие бенчмарки сейчас) пишут про то, что изменилось : 1. Подрос общий индекс способностей модельки: SotA результаты на их бенчмарках при меньшем количестве использованных токенов, чем Opus 4.6 или GPT 5.2-xhigh, при этом скорость генерации сильно выше. 2. Почти вдвое уменьшили количество галлюцинаций (88%->50%), но при этом количество общих знаний у модели…
Gemini 3.1 Pro model card Обновили нашу флагманскую модель, основной фокус в этом релизе на агентских способностях и кодинге, но и в общих способностях моделька подкачалась. Цена осталась такой же, как на 3 Pro. Поиграться, как обычно, можно на ai.dev
channel description
Машинное обучение, графы, языковые модели. Чуток про карьеру исследователя в FAANG, путь PhD и щепотка полезной математики. Связаться с автором: @deltaincorrect . Рекламы в канале нет.
channel info
similar channels/ai
tapswap community
TapSwap Community is a channel focused on converting taps into a financial tool, utilizing a bot for interaction.
Bum’s Corner 📦
BUM's Corner explores the evolution of a game IP into an AI-native ecosystem with digital companions.
DuckChain Announcement
DuckChain is a Telegram AI chain enabling users to engage with crypto through AI, EVM, and other technologies.
Need Services
Need Services offers a variety of digital services including VPNs, game top-ups, verification, eSIMs, and AI tools.
Hi, AI • Новости технологий
A Telegram channel providing news and updates on artificial intelligence and neural networks.
JGGL Official
JGGL is a social network focused on music creation and sharing, featuring an AI-powered track generator.
