● HABR WEEKLY DIGEST · AI / AGENTS / LLM

AI-статьи недели с Хабра

Разборы, рецепты и инструменты по LLM и агентам, которые можно применить: о чём статья — что главное — что попробовать за вечер.

🗓 окно 2026-07-27 — 2026-08-03 ⚡ статей: 10 👀 на заметку: 4 📡 отсканировано: 93
📝 О чём пишут на этой неделе

Неделя вышла не про то, что агенты умеют, а про то, сколько это стоит и как проверять их работу. Два прод-кейса выложили счета: агент на прод-логах живёт на $10 в месяц, конвейер от тикета до коммита — на $500, причём четыре пятых машинного времени уходит не на код, а на доказательство, что код работает. Третий сюжет — память: семантический поиск достаёт прошлое решение примерно в трети случаев, дальше нужны явные связи и отдельный слой фактов. Отдельная линия про инференс: гибридные модели выигрывают память, но ломают префиксное кеширование, а маленькая специализированная OCR-модель обгоняет семимиллиардную в пять раз.

Главные статьи недели

01

Агент читает прод-логи раз в полчаса и молчит в девяти случаях из десяти

✍ PsyGab Хабр ⏱ ≈10 мин ии-агенты мониторинг grafana loki
О чём

Автор посадил автономного агента читать 300 000 строк логов в сутки: цикл раз в полчаса, алерты в Telegram. За 84 дня — 113 алертов и два случая, когда агент соврал. Половина текста — про то, как заставить модель перепроверять себя, и это переносится на любого агента, который что-то считает по данным.

🔑 Главное
  • Вся интеграция — 20 строк bash: poll-loki.sh тянет {level=~"error|warn"} за пять минут, дальше решает модель. Медиана цикла — 15 секунд, примерно девять циклов из десяти заканчиваются молчанием.
  • Правило выходной двери: cron работает с --no-deliver, единственный способ попасть в канал — явный curl самого агента. Появилось после Opus, который за 48 часов прислал 16 сообщений вида «Now I have all data. Let me analyze…» и ноль алертов.
  • Модель врала дважды: дорисовала несуществующий токен бота (401 Unauthorized, два реальных бага потерялись) и посчитала 84 ошибки в час там, где их было 2,5 — экстраполировала 7 × 12 из пятиминутного окна.
  • Лекарство: находке нельзя верить, пока её не пересчитал тот, кто её не находил. Верификатор получает только кандидата и конфиг, считает другим запросом (|= "exception" против |~ "outcome.*exception"), порог ratio > 2.0 — отклонить.
  • 435 млн токенов за июль на подписке за $10, потому что 85% объёма — чтение кэша. Файл памяти дедупа распух до 65K токенов и грузился каждый цикл: после чистки расход упал с 6,8 до 0,75 млн в день.
⚡ Попробовать за вечер
  • Написать свой poll-loki.sh под источник логов и повесить cron раз в 30 минут на изолированную сессию с промптом «молчи, если это известный шум».
  • Прописать в промпт детектора два железных правила: экстраполяция запрещена, счётчики только сырые. Плюс таблицу отмазок — на «это явно баг, верификация излишня» контраргумент лежит прямо в скилле.
  • Отдельным скриптом пересчитать находку другим запросом и резать алерт при ratio > 2.0.
  • Метрика: за первую неделю — доля молчаливых циклов (цель от 80%) и число алертов, которые вы проверили руками и не подтвердили.
Схема конвейера: логи в Loki, цикл LLM раз в 30 минут, молчание по умолчанию, алерты в Telegram из статьи
На картинке: четыре шага конвейера с цифрами — объём логов, период цикла, доля молчаливых прогонов и то, что в итоге доходит до человека.
02

Девять недель замеров агентного конвейера: на код уходит пятая часть времени

✍ sae13 Хабр ⏱ ≈9 мин ии-агенты метрики разработки стоимость llm
О чём

Продолжение кейса про конвейер агентов, который ведёт задачу от тикета в YouTrack до коммита в C++-проекте на три миллиона строк. Здесь только замеры: что выросло, что сломалось и куда уходит машинное время. Ценна методика — автор считает не «мы сделали», а «у нас приняли».

🔑 Главное
  • Единица результата — Verified, а не Fixed: между «готово» и приёмкой случается Reopened. Поток принятых задач вырос с менее чем пяти до примерно 60 в неделю, три четверти закрыл конвейер.
  • 869 машинных часов за восемь недель, но на разбор, код и ревью пришлась лишь пятая часть. Остальное — сборки, доказательство в живом интерфейсе и независимая проверка: на каждый час кода почти четыре часа на «доказать, что работает».
  • Возвраты полезли вверх сразу после разгона, причём возвращали не за нерабочий код, а за неубедительное доказательство: кадр снят не в том месте или не в том масштабе. Ответ — независимый второй проход по каждому готовому результату.
  • $500 в месяц подписками против примерно $5700, если считать тот же объём по тарифам за токены. Аудит на Codex 5.6 Sol стоил около $17 за проход против примерно $3 у Claude, зато возвращал работу в каждом третьем проходе против одного из четырнадцати.
  • Тринадцатикратный рост оказался не свойством модели, а размером прежней пробки: проект годами жил в дефиците рук. Предел переехал на людей, которые ставят и принимают задачи.
⚡ Попробовать за вечер
  • Выгрузить из своего трекера поток принятых задач по неделям до и после агентов, отдельно пометив возвраты. Считать «принято», а не «сделано».
  • Разложить машинное время по стадиям: разбор, код и ревью против сборок и проверок. Если на код уходит меньше трети, ускорять генерацию бессмысленно.
  • Завести независимый второй проход на модели сильнее авторской и следить за долей возвратов как за метрикой качества.
  • Метрика: доля Reopened среди задач с решением тестера до и после введения второго прохода.
График принятых задач по неделям до и после запуска конвейера, со сводными метриками внизу из статьи
На картинке: перелом на графике принятых задач и четыре сводные цифры кейса — рост потока, медиана до первого исправления, машинные часы и месячный счёт.
03

Двенадцать политик вместо ревью: как выглядит governance для автономных агентов

✍ mvy (перевод) Хабр ⏱ ≈14 мин governance agentic coding
О чём

Разбор трёхуровневого governance-стека, собранного для платформы на NestJS и Next.js. Тезис простой: когда агент принимает тысячи микрорешений в час, разработчик физически не успевает их ревьюить, и суждение приходится кодировать заранее. В статье — состав стека до конкретных файлов, а не рассуждения про будущее профессии.

🔑 Главное
  • Три уровня автоматизации: чат (правила неявные), агент под присмотром (правила помогают), автономные агенты (правила обязательны). Переход автор сравнивает с путём DevOps от SSH-скриптов к Terraform.
  • Слой 1 — 12 документов-политик с пронумерованными разделами, чтобы ревьюер ссылался на §4.1, а не пересказывал правило: RFC 7807 и запрет throw new Error(), файлы до 400 строк и сложность до 10, LCP < 2,5 с и API p95 < 200 мс.
  • Слой 2 — 10 навыков, 6 специализированных агентов и 6 ревью-промптов. Ключевое правило: ревью-модель сильнее авторской. Pro читает то, что написала Fast, и ловит другой класс ошибок, потому что видит результат, а не ход рассуждений.
  • Слой 3 — семь фаз EXPLORE → PROPOSE → DESIGN → SPEC → TASKS → APPLY → ARCHIVE с последовательной заморозкой: прошёл ревью — артефакт заблокирован. Ревьюеры запускаются без истории разговора, поэтому артефакт обязан быть самодостаточным.
  • Задачи живут в репозитории markdown-файлами, статус — это положение в директории (open/ или archive/). Заводить задачи агент может только на фазах EXPLORE, SPEC и APPLY, чтобы не плодить побочную работу там, где нужна концентрация.
⚡ Попробовать за вечер
  • Взять один класс ошибок, который вы регулярно правите за агентом, и переписать соответствующий кусок CLAUDE.md как политику: пронумерованные разделы, дата принятия, ревью-чеклист.
  • Развести автора и ревьюера по моделям: дешёвая исполняет зафиксированную спецификацию, сильная ревьюит результат без доступа к истории разговора.
  • Добавить детерминированный скрипт валидации: все ли перекрёстные ссылки разрешаются, все ли обязательные файлы на месте. Эту проверку модель не обойдёт словами, потому что выполняется она не на LLM.
  • Метрика: сколько ваших ручных правок за неделю превратились в новый пример в политике, а сколько повторились второй раз.
04

Персистентная память агента: хранить факты, а не реплики

✍ YankovskiyVS · Cloud.ru Хабр ⏱ ≈17 мин ai-агенты mem0 персистентная память
О чём

Разбор от техлида продукта Evolution AI Agents: уровни памяти, что хранить, как обновлять и как удалять. Начинается с редкого для темы утверждения — память нужна не всегда, и решает это сценарий. Дальше идут архитектуры и типовые ошибки, которые ловятся уже в проде.

🔑 Главное
  • Контекст — то, что помещается в окно модели и участвует в каждом запросе. Память — то, что живёт вне модели и подгружается выборочно. В 80% продуктовых задач хватает short-term плюс long-term semantic.
  • Просто хранить историю диалога — ещё не память: нужны извлечение фактов, дедупликация, разрешение конфликтов, инвалидация. Но оригинал реплики хранится рядом с фактом и связан с ним ссылкой, иначе ошибку интерпретации уже не откатить.
  • Дефолт — pgvector: гибридный запрос «похожие по смыслу, только этого пользователя, только свежие» собирается одной SQL-конструкцией. На Qdrant уходят не из-за скорости, а из-за recall при селективных фильтрах, потому что post-filtering режет качество выдачи.
  • Рабочий паттерн — два слоя: структурированный хранит атомарные факты (один факт — одна актуальная запись), векторный хранит эпизоды. Сначала дёшево достаём точные факты, потом добавляем похожие эпизоды.
  • Автоматически писать в память всё, что выдала LLM после шага, нельзя: туда попадут промпт-инъекции из писем, сайтов и ответов API. Схема двухшаговая — модель предлагает кандидата с источником, отдельный процесс проверяет источник, идентичность пользователя, достоверность и чувствительность.
⚡ Попробовать за вечер
  • Прогнать свой сценарий и честно ответить, что агент должен помнить между сессиями и зачем. Если без памяти сценарий не ломается — не подключать.
  • Поднять pgvector в существующем Postgres и разложить память на два слоя: таблица атомарных фактов плюс векторный индекс эпизодов. Изоляция по user_id и tenant_id прямо в запросе, а не постфактум в приложении.
  • Вынести запись в отдельный шаг: LLM возвращает кандидата с источником, проверка решает, писать или нет. Противоречие — это инвалидация старого факта с окном валидности, а не молчаливая перезапись.
  • Метрика: доля фактов в памяти, источник которых — внешний API или содержимое документа, а не диалог с пользователем. Это ваша поверхность для инъекций.
05

Семантика достаёт прошлый фикс в трети случаев, граф причинных связей — почти всегда

✍ ideavi Хабр ⏱ ≈6 мин память агента RAG бенчмарк
О чём

Автор померил, достаёт ли ассистент прошлое решение по симптому бага, и прогнал тот же скрипт по чужому репозиторию — ydb-platform/ydb, 10 285 issue и 37 067 PR. Ценность в методе: разметка строится регулярным выражением по Closes #N, вызовов LLM ноль, gold-пары выложены целиком, так что результат можно опровергнуть.

🔑 Главное
  • Семантический поиск нашёл закрывающий PR по заголовку issue в 32,1% случаев, обход причинных рёбер «issue → закрывший PR» — в 94,5%. Вклад графа +62,5 п. п.
  • На собственном корпусе автора числа другие (38,0% и 87,0%), но картина та же. Переносится закономерность, а не цифра: сходство слов упирается примерно в треть при любом языке и домене.
  • Чужой корпус вскрыл ловушку: 53% свежих PR создаёт бот ydbot механическими синками из внутреннего монорепозитория. На 4000 свежих PR нашлось всего 47 пригодных пар, пришлось фильтровать механических авторов.
  • Равный бюджет выдачи обязателен — 32 узла в обеих руках, иначе сравниваются размеры окна, а не методы. Корпус и разметка строятся из одного и того же окна, иначе промах говорит о границах выгрузки.
  • В том же корпусе — 173 PR со словом revert в заголовке, 2067 issue со словом flaky и 356 с regression. Одну и ту же работу переоткрывают даже в дисциплинированном инфраструктурном проекте.
⚡ Попробовать за вечер
  • Выгрузить свой репозиторий двумя командами: gh pr list --json number,createdAt,author,title,body и то же для issue.
  • Собрать gold-пары регуляркой \b(?:clos|fix|resolv)\w*\s+#(\d+), отбросив ботов и потребовав, чтобы цель была issue из того же окна.
  • Прогнать две руки при равном бюджете выдачи: top-32 по косинусу против обхода рёбер на глубину 3 от тех же засевов.
  • Метрика: ваш собственный chain-hit по обеим рукам. Разница между ними и есть то, что ассистент теряет без явных причинных связей.
Схема: семантический поиск против обхода причинных рёбер, с цифрами 32% и 95% из статьи
На картинке: два способа дойти от симптома до закрывшего его PR и результат замера на чужом корпусе — 19 000 узлов, 293 gold-пары, разметка регуляркой без вызовов LLM.
06

Гибридная модель экономит память, но ломает префиксный кеш

✍ YUNGC0DE Хабр ⏱ ≈20 мин vLLM KV-кеш инференс LLM
О чём

Автор снял на вечер машину с RTX 3090 и прогнал одну агентскую нагрузку по обычной Qwen3-4B и гибридной Qwen3.5-4B, где 24 слоя из 32 заменены на рекуррентные Gated DeltaNet. Вывод против ожиданий: под нагрузкой гибрид чаще проигрывает, и отставание сидит в кеше, а не в скорости самой модели.

🔑 Главное
  • KV на токен — 36 КБ против 144, ёмкость кеша 274–297 тысяч токенов против 93–98 тысяч на той же карте. По ёмкости гибрид выигрывает в 3,2 раза.
  • Платит он гранулярностью: рекуррентные состояния и KV лежат в одном пуле, страницы обязаны быть одного размера, и vLLM поднимает блок кеша с 16 до 528 токенов. Флагом --block-size 16 это не лечится, движок умеет размер только повышать.
  • На малом рабочем наборе разрыв в попаданиях ровно 10 п. п. (94,3% против 84,0%), а TTFT вдвое хуже: 58–61 мс против 99–109. Средняя потеря на границе блока — половина блока, то есть 264 токена лишнего пересчёта на каждый запрос.
  • Для гибридных моделей vLLM 0.26 выключает префиксное кеширование по умолчанию. Забытый --enable-prefix-caching роняет обслуженные запросы с 7,58 до 2,74 в секунду, при этом лог чистый и успешность 1.0.
  • Архитектуру определяет произведение длины контекста на длину ответа. При контексте 8 тысяч токенов гибрид отыгрывает отставание за первые 40 токенов ответа, а на вызове инструмента в 30 токенов уже нет.
⚡ Попробовать за вечер
  • Прогнать одну строку на своём инференсе: vllm serve <model> 2>&1 | grep -Ei 'prefix_caching|attention block size|KV cache size'. Она сразу показывает, включён ли кеш, каков блок и какая ёмкость.
  • Если модель гибридная — поставить --enable-prefix-caching руками и перемерить обслуженные запросы в секунду под своей нагрузкой.
  • Посчитать KV на токен ещё до аренды GPU: 2 × слои × KV-головы × размерность головы × 2 байта, все множители лежат в config.json.
  • Метрика: попадания в кеш по разности счётчиков vllm:prefix_cache_queries_total и vllm:prefix_cache_hits_total до и после прогона.
07

Девять OCR-моделей на трёх движках: специализация обгоняет размер в пять раз

✍ lev_bogdanov · MWS AI Хабр ⏱ ≈10 мин OCR vlm бенчмарки
О чём

Команда прогнала девять моделей на трёх движках инференса и свела результат в таблицу «сценарий → рекомендация». Рукописный русский взят намеренно: если модель справляется здесь, на печатных документах справится тем более. Полезно, когда выбираешь между классическим OCR и VLM, а комбинаций «модель + движок» — десятки.

🔑 Главное
  • Скорость без полноты — бесполезная метрика. Tesseract лидирует по страницам в минуту (193), но отдаёт 411 символов на страницу против 1193 токенов у PaddleOCR-VL: на сложных изображениях он молча пропускает то, в чём не уверен.
  • PaddleOCR-VL на 1,7 млрд параметров обгоняет Qwen2.5-VL-7B в 5,2 раза по страницам в минуту и в 6,7 раза по токенам в секунду.
  • Native HF Transformers отстаёт вдвое от vLLM и SGLang на той же модели и той же карте: 10,9 против 21,1–21,3 стр/мин при утилизации GPU 64% против 97–99%. Для прода не годится.
  • vLLM и SGLang по пропускной способности идут в пределах погрешности. У vLLM лучше TTFT (78 мс против 122) и шире поддержка моделей, SGLang экономнее по памяти (57 ГБ против 69).
  • От 30 до 40% объёма вывода у специализированных моделей — не текст, а Markdown-разметка: заголовки, таблицы, списки. Из-за неё разрыв в страницах меньше, чем в токенах.
⚡ Попробовать за вечер
  • Собрать 15 своих типовых документов, включая заведомо плохие сканы, и прогнать связку PaddleOCR-VL + vLLM против того, что стоит сейчас.
  • Зафиксировать условия честного сравнения: bfloat16, temperature=0, одинаковый препроцессинг, пять прогревочных прогонов до замеров.
  • Считать не только страницы в минуту, но и символы или токены на страницу, иначе пустой ответ выглядит победой.
  • Метрика: полнота вывода на пяти худших сканах. Если новый движок быстрее, но отдаёт меньше символов, выигрыш мнимый.
08

LiteLLM: один шлюз к сотне провайдеров, фолбэки и учёт расхода

✍ tailo · Selectel Хабр ⏱ ≈9 мин litellm llm
О чём

Разбор LiteLLM — прокси-шлюза, который приводит больше сотни провайдеров к формату OpenAI API. Пригодится, когда несколько сервисов ходят каждый в свою модель, а вам нужен один интерфейс, общие лимиты и понятный счёт по каждому потребителю.

🔑 Главное
  • Код пишется один раз под chat/completions, дальше модель меняется в конфиге. Локально Ollama, в проде облачная модель — без правок в коде.
  • Конфиг делится на четыре блока: model_list перечисляет модели, litellm_settings задаёт общие параметры запросов, router_settings — таймауты, фолбэки и повторы, general_settings — сам инстанс.
  • Разворачивается одним docker run с пробросом ключей через переменные окружения и монтированием конфига.
  • Веб-интерфейс на localhost:4000/ui показывает расход и логи запросов, раздаёт виртуальные ключи и бюджеты по пользователям и командам. Для него нужно подключить базу через database_url, иначе залогиниться не выйдет.
  • В статье наглядно видно, зачем нужны фолбэки: на один и тот же вопрос Perplexity Sonar ответил верно, а gpt-oss через Groq — уверенно неправильно.
⚡ Попробовать за вечер
  • Поднять LiteLLM в докере, описать в model_list две модели от разных провайдеров и прописать взаимные фолбэки в router_settings.
  • Переключить один свой сервис на http://localhost:4000/v1/chat/completions и убедиться, что смена модели — это правка одной строки конфига.
  • Подключить Postgres через database_url и открыть вкладку Usage: сколько на самом деле стоит каждый сервис.
  • Метрика: расход за неделю в разбивке по сервисам и моделям. До шлюза этих цифр обычно нет.
09

Две дыры в платежах, которые модель пропускает почти всегда

✍ kh-vibecoding Хабр ⏱ ≈3 мин платежи безопасность вебхуки
О чём

Короткий текст от человека, который собирает продукты с помощью ИИ. Главная мысль: опаснее всего код, который модель написала так, что он выглядит рабочим. Ценность здесь даже не в списке защит, а в приёме — как ставить задачу до того, как агент начнёт писать.

🔑 Главное
  • Подмена цены: если проверка суммы на фронтенде, покупатель меняет $100 на $1 прямо в коде страницы. Модель реализует то, что видно в интерфейсе, а не то, что происходит на сервере.
  • Отсутствие проверки вебхуков ломается в обе стороны: закрыл вкладку сразу после списания — деньги ушли, доступа нет; открыл адрес страницы «Спасибо» напрямую — получил доступ бесплатно.
  • Обе ошибки не ловятся обычным тестированием, потому что проверяют два сценария — оплатил и не оплатил. Атакующему интересен третий путь, которого в голове проверяющего нет.
  • Первый запрос к модели на критичной фиче — не про код: «не пиши код, изучи документацию и типовые уязвимости, дай 2–3 варианта с плюсами и минусами и скажи, что рекомендуешь и почему».
  • Перед сдачей — атака на свой продукт из чистой сессии. Агент, который знает, как задумано, защищает замысел; агент, который видит только код, ищет способ его обмануть. Автор честно оговаривает: это дешёвый первый фильтр, а не пентест.
⚡ Попробовать за вечер
  • Взять свой самый денежный эндпоинт и проверить руками, где считается сумма. Если её присылает клиент — это дыра.
  • На следующей критичной фиче начать с запроса «не пиши код»: варианты, плюсы, минусы, рекомендация с обоснованием.
  • Открыть чистую сессию без истории проектирования, дать агенту только код и одну задачу: обойти оплату.
  • Метрика: сколько находок из чистой сессии пережили ручную перепроверку. Остальное — шум, который агенты выдают уверенным тоном.
10

Стилевая LoRA на 30 картинках: размечаем то, что модель не должна выучить

✍ Error19 Хабр ⏱ ≈31 мин stable diffusion lora comfyui
О чём

Пошаговый разбор: как обучить стилевую LoRA для SD 1.5 на 30 картинках и собрать из этого повторяемый пайплайн для серии иллюстраций в одном стиле. Стикеры тут дело десятое: интересна логика разметки, она контринтуитивная и переносится на любую стилевую задачу.

🔑 Главное
  • Размечать нужно то, что модель не должна выучить. Стиль в caption не описывается — тогда он привязывается к уникальному триггеру. Итоговая строка выглядит так: vkstckrs, vampire with red eyes and black hair.
  • Триггер выбирается так, чтобы у текстового энкодера не было для него готового значения: vkstckrs, а не обычное английское слово, иначе поведение LoRA смешается с тем, что базовая модель знала до обучения.
  • Датасет собирался по одному изображению из пака, чтобы модель не запомнила конкретного персонажа вместо жанра. Прозрачный фон заменён на белый, всё переведено в JPG.
  • Параметры: SD 1.5, AdamW, LR 1e-4 для UNet и 1e-5 для текстового энкодера, rank/alpha 32/16, batch 1, 512×512, fp16, 100 эпох. Обучение занимало около 20 ГБ оперативной и 3 ГБ видеопамяти.
  • Останавливаться нужно не по loss: у генеративных моделей его падение не значит, что поздний чекпоинт лучше. После 1700 шагов разница между сэмплами стала неочевидной, обучение остановили на 2500. Для генерации базовый чекпоинт не подошёл — взяли производную модель с CivitAI.
⚡ Попробовать за вечер
  • Собрать 25–30 картинок одного стиля, но с разными субъектами, и разметить их через Salesforce/blip-image-captioning-large с фиксированной подстрокой про стиль, которую потом удалить скриптом.
  • Обучить в OneTrainer с параметрами выше и сохранением каждые 100 шагов, а сэмплы смотреть глазами, а не по графику loss.
  • Собрать в ComfyUI workflow с переключателем LoRA и фиксированным сидом, чтобы сравнивать «до» и «после» на одной генерации.
  • Метрика: держится ли стиль на субъектах, которых не было в датасете. Если LoRA воспроизводит конкретного персонажа — датасет собран неправильно.
Исходный кадр слева и четыре сгенерированные иллюстрации в едином стиле справа из статьи
На картинке: результат обучения — серия консистентных изображений с общим контуром, палитрой и белым фоном, ради которой всё и затевалось.
💬

На что обратить внимание

Статьи и темы, которые стоит держать в голове, но в готовый рецепт «попробовать вечером» они не складываются.

🧬 Агент, который переписал сам себя

Агентный цикл на чистом Python с доступом к git, правом переписывать свой рантайм, безопасным рестартом и откатом к прошлой версии. Автор заявляет результаты уровня SOTA на Terminal-Bench 2.1, CL-Bench и OSWorld; внешне эти цифры не подтверждены. А вот безопасный рестарт с откатом применим и без самоэволюции — так можно катить изменения в рантайм любого долгоживущего агента.

Читать ↗

🦀 Компилятор Svelte на Rust за 106 вечеров и $700

✍ MrWaipХабр

Автор пять с половиной месяцев писал компилятор руками и бросил, а через год вернулся с агентом и доделал. Редкий случай, когда у агентной разработки названы и срок, и ценник.

Читать ↗

🔐 Gemini Spark получил доступ к вашим логинам в Chrome

Google связала облачный агент с локальным браузером: он открывает сайты с активными сессиями и с разрешения пользуется сохранёнными данными для входа. Разбор того, что агент получает на самом деле и почему корпоративная документация Chrome советует администраторам сначала проверить модель угроз.

Читать ↗

🗣 Silero: синтез речи ещё для 29 языков России

✍ snakers4Хабр

Закрыты абхазо-адыгские и нахско-дагестанские языки, которые в прошлом релизе не покрывались вообще. Если вы делаете TTS за пределами русского и английского, список поддерживаемых языков стал заметно длиннее.

Читать ↗
🎯

Мой план на эту неделю

Из всех статей выше — три, по которым реально что-то сделаю. Не «прочитать», а внедрить.

Померить: causal recall на своём репозитории — выгрузка через gh, gold-пары регуляркой по Closes #N, две руки при равном бюджете выдачи
до пятницы
Проверить: лог старта своего vLLM на prefix_caching и размер блока; если модель гибридная — включить кеш руками и перемерить запросы в секунду
до среды
Посадить: агента на логи одного сервиса с правилом «молчи, если известный шум» и отсечкой ratio > 2.0 на верификации
до конца месяца
#

Метаданные

сгенерировано 2026-08-03T05:46:48Z
окно 2026-07-27 — 2026-08-03 (7 дней)
отсканировано / в дайджест 93 / 14
источник Habr RSS (хабы: Искусственный интеллект, Машинное обучение, Natural Language Processing, топ недели)
пропущенные фиды нет
×
Открыть статью