Ru
Главная → Каналы → Борис опять

Борис опять

@boris_again
Подписаться в Telegram
В ленте @TgTopFeedBot на канал подписано: 1

Публикации всего: 86

Постов на странице: 10 30 50 Страница 1 из 9
секретное 35 собеседование в Яндекс
😢 50 👍 12 🤬 6 · всего 78 Перейти к публикации →
Только что выкладывал здесь свой доклад "Vibemathed", а тут OpenAI подтвердила давние слухи и выложила массу новых результатов в виде препринтов. Большой пост об этом писать не знаю как, учитывая, что большинство этих результатов я не понимаю даже на уровне формулировки. Но вот что при беглом прочтении кажется самым главным в списке: — 003: квазигипотеза Римана, ну тут без вопросов, это огромный качественный прорыв; — 032: гипотезы Ходжа и Тейта для важных случаев; это не вполне закрытая задача на миллион, но тоже очевидны огромные последствия; — 004: десятая проблема Гильберта над Q; это я выбрал больше ностальгически как большой привет Юрию Владимировичу Матиясевичу, но это и правда была важная задача; — 034: гипотеза изобилия, которая важна для классификации алгебраических многообразий; — 002 + 006: гипотеза Бёрча-Свиннертона-Даера и гипотеза Голдфельда, которые в сумме тоже дают большой шаг к ещё одной задаче тысячелетия (но она не закрыта ещё совсем); — 159: гипотеза Эрдёша об арифметических прогрессиях. И в информатике, где я всё-таки могу понять, о чём конкретно идёт речь: — 102: unique games; получены точные пределы приближения, и это сразу даёт массу результатов о (не)приближаемости разных NP-трудных задач; — 103: L = RL = BPL, полная дерандомизация в классе алгоритмов с логарифмической памятью; — 107: экспонента в сложности умножения матриц над С сведена до 2.25; новые алгоритмы об умножении матриц регулярно придумывают, в том числе автоматически, но здесь реально огромный скачок. В целом, если бы это не было частью глобальной AI-революции, текст со скромным названием "OpenAI Research Catalog" стал бы главным математическим текстом тысячелетия, а может, и двух. Но вопрос уже давно стоит шире любой конкретной задачи, будь она хоть на миллион, хоть на два. Выделю главную заключительную мысль из моего доклада, да и вообще из текущего математического zeitgeist (недавно как раз об этом разговаривал в дружественном канале Валентина Малых). Главное в том, что сейчас пока не вполне понятно как, но точно радикально меняется понятие "результата" в математике. Раньше как было: основной результат математика — доказанные теоремы. Если именную гипотезу доказал, над которой люди долго думали и не придумали, ты точно молодец. Это относительно легко проверяемая специалистами вещь (бывают исключения вроде abc-гипотезы, но они редки), и если специалисты проверили, то легко согласиться с тем, что результат есть и он крутой. Даже если надо быть очень узким специалистом, чтобы понять суть твоей работы. Конечно, я упрощаю, конечно, математики бывают разные, и это долгий разговор, но в целом было примерно так. Сейчас ситуация изменилась радикально. Доказательства теперь не то чтобы ничего не стоят: не любую задачу можно решить, задачи бывают сложнее и проще, а AI-модели не всемогущи. Но человек перестал быть основным средством доказательства теорем, то есть доказательства перестали принадлежать людям. Пока ещё нужно проверять результаты и переписывать более понятно для других людей, но это тоже нужно всё в меньшей степени. Что такое "результат" для человека теперь, математики пока не согласились, и любое новое определение ведёт к серьёзным институциональным изменениям. Да и вообще непонятно, что такое теперь "быть математиком". И это не думерский прогноз, а реальный вопрос, на который математическому сообществу придётся отвечать прямо сейчас. Ещё одна важная деталь в том, что это результаты внутренней модели OpenAI. Иначе говоря, новые доказательства теперь не просто не людьми делаются, но и получить их из "чёрного ящика пришельцев" могут только очень специальные люди. И, как вы понимаете, пока я говорю о математике, потому что там это уже случилось. Но другие науки ждёт то же самое в ближайшем будущем, а там и не только науки. Дивный новый мир становится всё интереснее... #ai #math #news #blog
👍 25 🔥 12 ❤ 2 Перейти к публикации →
#дайджест Дайджест AI/ML за неделю 28 сентября – 4 октября 2026 Google: Gemini 4 Argon Верните мне мой 2024-й. Google наконец выпустила фронтир, но не вам. Первое место в Vals Index с 68.9 против 67.0 у Opus 5.5, DeepSWE 77.9% против 74.2% у Opus и 74.1% у Astra. В индексе AA 53, то есть ровно Astra и Fable, Opus 5.5 с 58 впереди. Галлюцинирует меньше всех: 15% против 51% у Astra. Выход до 1М токенов. $2/$10 на старте, потом $4/$20. Доступ только партнерам, потом платный API и Ultra, когда - не сказано. Но через Блумберг, сотрудники Google говорят, что на бенчах лучше чем в жизни. Блогпост, бенчмарки, Vals Anthropic: Claude Sonnet 5.5 Sonnet, достойный Opus 5.5. Бьет Опус на Terminal-Bench 70.6% vs 66.4%, в остальном отстает на пару пунктов: CursorBench 55.5% против 57.8%. Цена та же $2/$10, на 30% быстрее Sonnet 5. В max режиме сжигает 193К токенов на задачу, больше всех измеренных моделей, так что считать его дешевле Opus стоит осторожно. А еще теперь у Sonnet киберограничения как у Opus с откатом на Sonnet 5. Блогпост OpenAI: DevDay, GPT-6.1 Sol и Dots DevDay с 20+ анонсами. GPT-6.1 Sol - апгрейд GPT-6 Sol за те же $2/$10 с кэшем $0.10: DeepSWE 75.2% против 68.8%, то есть по бенчам примерно уровень Astra в пять раз дешевле. Dots - возмещение за обрезание $200 подписки пополам. Постоянно работающие агенты на Astra со своим облачным компьютером и 4000 интеграций. Разное -  новый тариф за $500 с режимом Ultrafast (до 8x скорости в Codex), Decisions API на Luna (Jev у нас дома), Agents API с computer use, Codex в облаке и тд и тп. Рекап, InfoQ Runway: Praxis-1 Runway вслед за FLUX теперь тоже про роботов. Praxis-1 - world action model на том же видео-претрейне, учится в основном на чужих роликах с YouTube, а не на телеоперации: после файнтюна ошибка 16.1см против 16.0 у претрейна на реальном роботе. Смогли мы всему научиться по видео на Youtube, смогут и роботы. Сравнений с FLUX 3 Action нет, веса обещают "в ближайшие месяцы". Исследование ElevenLabs: Eleven v4 и v4 Turbo Новая архитектура, больше языков, клон голоса по 10 секундам, аудиотеги теперь можно стакать и модель выполняет их по порядку. Turbo для агентов с ~150 мс до первого звука и начинает говорить, пока LLM еще пишет. Первое место у Artificial Analysis. $22 и $11 за миллион символов со скидкой. Блогпост, TechCrunch BFL: FLUX 3 Image Из нового - редактирование без дрейфа: правишь объект, остальные пиксели не трогаются. Раскладка через рамки в промпте, до 10 референсов, до 4K. $0.048 за 1K, $0.61 за 4K, открытые веса "через несколько недель". Модель Ideogram: 4.5 - тоже про многошаговое редактирование без накопления артефактов, открытые веса тоже только обещают. До 4 референсов на правку, нативные 2K, четыре режима качества от 0.8 до 22 центов за картинку X Менее важные новости: Jev: две недели спустя 12 million views for a JSON classifier? Yeah, we're in a bubble. Но и это не конец, JSON classifier за $40М породил индустрию. Опенсорс (и не только) успел наклепать примерно миллион копий. Clef, Kev имя им легион. Figure: F.02 decommission - старые роботы крутят сальтухи в дуговую печь и косплеят Терминатор 2 с настоящим Шварценеггером, в общем просто красиво. X RoboParty: RP1 - полностью открытый гуманоид. На IROS его пинали посетители. Пресс-релиз Bilibili: Index-Translate - переводчики на Qwen3.5. 150 языков, 2B/9B/35B-A3B, на FLORES 0.879 против 0.865 у GPT-5.6 Sol. GitHub Suno: Speech - озвучка текста с музыкой под него одним проходом, до 8 минут, бета для всех. X
❤ 5 👍 4 🔥 2 Перейти к публикации →
https://x.com/MistralAI/status/2107456586813730854 Они правда релизнули Le Chaton Fat
🔥 21 ❤ 3 👍 1 · всего 26 Перейти к публикации →
Объединяем исследователей для обучения ИИ долгосрочному планированию Владислав Куренков, руководитель научной группы «Адаптивные агенты» Института AIRI, запустил открытое сообщество людей, работающих над системами планирования ИИ, чтобы вместе решить одну из самых неподатливых для искусственного интеллекта игр — NetHack. У каждого участника будет свой способ получить программу, свои инструменты и своя стратегия, а общая инфраструктура позволит видеть результаты друг друга, сравнивать их между собой и продолжать разрабатывать решения друг друга. Владислав рассказал, почему NetHack весьма полезна для обучения ИИ: «Одна партия в NetHack — это десятки тысяч ходов. Жизнь у героя одна, сохранений нет, подземелье каждый раз новое, а игра по дороге ничего не подсказывает. Если вы сыграли плохо, то выясняется это тогда, когда ничего исправить уже нельзя. Когда мы запускаем наших ботов играть, то вторая по частоте причина их "смерти" — голод, потому что они не позаботились о еде за несколько тысяч ходов до финального момента. На таких же ошибках спотыкаются ИИ-агенты, когда пишут код: отдельный шаг они выполняют прекрасно, а на длинную дистанцию держать планку не могут. И NetHack в этом плане становится весьма полезной для обучения ИИ». 📎Подробнее про сообщество, игру и «интеллект» агента — в интервью «Ъ-Науке».
👍 8 ❤ 3 👎 3 · всего 18 Перейти к публикации →
Любая достаточно развитая технология неотличима от аи слопа
🔥 15 ❤ 3 👍 3 · всего 23 Перейти к публикации →
Команда Т-Банка хотела тестировать нейросетевые модели для ранжирования, но на их внедрение уходило слишком много времени. Поэтому сделали open source-библиотеку scikit-rank. Она оборачивает нейросетевые модели в формат scikit-learn-моделей с привычными методами fit и predict, а переписывать всю обработку данных и обучение больше не нужно. Почему это важно – посмотрим на примере ИИ-агентов. Если попросить агента с нуля реализовать DCN v2, он будет с нуля писать архитектуру и, скорее всего, допускать больше неточностей. А если дать задачу завести DCN v2 из Scikit-Rank, агент прочитает README репозитория и использует готовую реализацию, что потребует меньше токенов и снизит вероятность ошибок. На внутренних задачах модели дали прирост 3-7% по офлайн-метрикам и 4-7% по бизнес-метрикам. Работу о библиотеке представили на конференции ACM RecSys 2026. https://habr.com/ru/companies/tbank/articles/1088224/
👍 51 ❤ 39 🔥 19 · всего 125 Перейти к публикации →
#дайджест Дайджест AI/ML за неделю 21–27 сентября 2026 Anthropic: Claude Opus 5.5 Опять менять подписку. Opus 5.5 обгоняет Fable 5.1 почти по всей таблице: Terminal-Bench 4.0 66.4% против 55.8% (у Astra 57.9%), CursorBench 57.8% против 51.8%, HLE 67.7% против 65.6%. При этом $4/$20 вместо $5/$25 у Opus 5, кэш $0.20, на 30% быстрее, типичные задачи на 40% дешевле. Первый релиз после того как Амодей призвал притормозить фронтир. Sonnet и Haiku 5.5 обещают через несколько недель. Блогпост, AA OpenAI: GPT-6 Sol и GPT-6 Luna По совпадению вышли через полтора часа после Opus 5.5. Модели подросли по бенчам, но главное - подешевели в 2 раза: Sol $2/$10, Luna $0.10/$0.50. Обещают вдвое меньше фактических ошибок чем у 5.6 Sol. Terra в шестом поколении нет. Не Opus 5.5 конечно, но новые парето-оптимальные модели. Блогпост, форум xAI: Grok 4.7 2.1T параметров, на 40% больше Grok 4.6, контекст 500К, цена та же $2/$6. В индексе интеллекта AA 46 против 53 у Fable и GPT-6. Из плюсов: SOTA на бенчмарке по электротехнике. Из минусов: гайки цензуры прикрутили, NSFW больше нет. С каждым днем мы все дальше от МехаГитлера. Блогпост Xiaomi: MiMo-V2.6 Pro и Flash Открытые омнимодальные модели под MIT: текст, картинки, видео и аудио на входе, контекст 1М. Pro набирает 46 в индексе AA, то есть уровень Grok 4.7 и лучший результат среди открытых. Flash $0.14/$0.28, кэш $0.0028. Если хотите отвлечься от чтения слопокода - с весами выложили 7000+ RL-окружений для кода, уязвимостей и веба и весь пайплайн обучения, а RL-фаза, по их словам, стоила $2.62М для Pro и $850К для Flash. Бонусом 9B дистиллят на базе Qwen3.5. Блогпост, RL, HF BFL: FLUX 3 Action Открытая 7B world action model для роботов: по картинкам с камер, состоянию и инструкции предсказывает следующие действия и заодно будущие кадры. На RoboLab-120 42.9% против 36.8% у Cosmos 3 Nano на 16B, до 3.95 раза быстрее. Интегрирована в LeRobot, есть рецепты файнтюна. Модель, HF Alibaba: Qwen-Audio-3.1 Пять моделей: ASR, TTS и Realtime модели обновили и удешевили, а также из интересного добавили умные версии ASR и TTS: ASR-Next - Распознает эмоции, роли, фоновые шумы, убирает эээ слова-паразиты TTS-Next - можно кроме самой речи прописывать эффекты, эмоции, тайминги и тд Блогпост, X Google: Gemini 3.8 Flash TTS и Flash-Lite TTS Flash для актерской игры и дизайна голосов, Lite для дубляжа и агентов. 100+ языков, 2000+ голосов, клонирование по 30 секундам с устным согласием владельца, SynthID в каждом файле. В оценке Hume обе заняли первые два места. Блогпост, API Tencent: Hy погоди Image 3.5 Preview До 20 референсов вместо трех, многоходовое редактирование с памятью сессии, 4K на выходе. Обещают 30% прироста по human eval относительно 3.0. $0.024 за картинку против $0.045–0.211 у GPT Image 2.5. Весов нет, только API и бесплатно в Miora до 7 октября. KuCoin DeepSeek: DSec Статья про инфраструктуру песочниц для RL от DeepSeek, которая обслуживала все RL раны от V3.2 до V4.1. Есть отдельная глава про то, как агенты ломали песочницу ради награды. Статья inclusionAI: Ming-Image-0.1-Design - 6B под MIT для UI, инфографики и постеров с читаемым текстом и RGBA на выходе, плюс Design-Layer, который раскладывает готовый макет на слои. Первое место среди открытых на UI/UX лидерборде AA. HF, GitHub Fireworks: Ember-1 - Kimi K3, дообученная думать на 40% короче без потери качества: DeepSWE 75.2 против 66.4 у базовой K3, Terminal-Bench 2.1 82.0. $3/$15, research preview, весов нет. Блогпост
❤ 9 👍 3 🔥 3 Перейти к публикации →
Стартуем наше ежегодное исследование дата-специалистов! Чтобы учесть быстро меняющиеся условия работы всей индустрии, мы кардинально пересобрали структуру анкеты. Вот, что ждет внутри: 🤖 Насколько глубоко AI встроен в вашу работу: от разовых запросов в чате до собственных агентов под регулярные задачи. И как за год изменилось время на разные типы задач. 🧩 Кто какие шаги делает руками: от постановки задачи с бизнесом до мониторинга модели в проде. Сравним, как эти списки выглядят у разных ролей. 📈 Кем работали до перехода в данные и как менялись роли потом. Соберем карту переходов внутри направления. 💼 Как на собеседованиях дата-специалистов относятся к AI — разрешают, требуют или следят, чтобы не пользовались. И, конечно, традиционные блоки про развитие и сообщество, чтобы собрать полезные списки ресурсов ⏱ Опрос займет 12–15 минут 📬 Отчет опубликуем в ноябре 👉 https://survey.devcrowd.ru/data-2026 🔁 Пересылайте коллегам из data-направления - добавим больше данных!
👍 3 🔥 2 ❤ 1 Перейти к публикации →
# Road Machiners https://btseytlin.itch.io/road-machiners Любой мужчина в своей жизни должен сделать свою игру где можно грабить корованы. В субботу я задумался: какую игру я всегда хотел сделать, но не хватало безработности? За выходные навайбкодил помесь между Ex Machina и Space Rangers 2. Встречайте: Пустынные Рейнджеры Road Machiners. Машинки ездят, грабят и оказываются ограбленными. NPC может запомнить, что вы его ограбили, и позже отомстить. Можно торговать, лутать, общаться по радио, выполнять немногочисленные квесты, исследовать. Я удивлен, но оно даже похоже на прототип полноценной игры! Я беру назад все свои слова про то, что вайбкодинг не работает. Видимо он работает когда занимаешься чем-то бесполезным! Вся игра сделана на 100% вайбах. Не автономно. Но я просто говорил Opus 5.5 свои хотелки вида "а давай короче музыка в бою будет генерироваться в зависимости от того, что происходит, типа в кого-то попал или врезался...", а он делал. Звуки ElevenLabs, модельки блендером.
🔥 61 ❤ 9 👍 6 Перейти к публикации →
1 2 3 … 8 9