Programming Mentor
4.01K subscribers
184 photos
1 video
13 files
421 links
Ти живеш, поки вчишся
Download Telegram
Про метрики

В умовах перебудови SDLC під тиском агентної розробки, питання метрик насправді дуже проблемне зараз у багатьох.

Але я завжди раджу не потрапити в пастку tokenmaxxing, бо як тільки розробників починають ранжувати за обсягом спалених токенів, то будь-якому розумному розробнику треба буквально 5 хвилин, щоб навантажити своїх AI агентів на максимальне спалювання токенів. І я не говорю про якусь абстрактну роботу, це може бути щось "умовно корисне", наприклад, усунення технічного боргу чи ще краще - робота над якоюсь фічею в циклі.

Для прикладу, я імплементував Фабрику проєктів з купою різних верифікацій і якщо її запустити над якоюсь задачею і поставити ціль довести до досконалості, то вона нон-стоп буде спалювати $1000 тис. в токенах на добу дуже легко :)

А що тоді по метрикам? А тут не треба винаходити велосипед - треба виміряти і зафіксувати звичайні проєктні метрики, наприклад, DORA: частота деплойментів, lead time від коміту до продакшена, відсоток невдалих змін (change failure rate) та час відновлення після інциденту. До них можна додати cycle time по задачах, escaped defects (скільки багів долетіло до продакшена), і головне - реальний throughput бізнес-цінності: скільки фіч чи задач з беклогу фактично закрито і прийнято.

Але токени тежє варто міряти, однак це витрати, а не результат. Тому їм місце в знаменнику, а не в чисельнику. Цікава метрика не "скільки токенів спалив розробник", а "скільки коштує в токенах одна доставлена фіча" або "одна закрита задача".

І тоді ми і adoption поміряємо, і delivery, бо роздування витрат без росту результату одразу видно. А розробник, який за $20 в токенах закриває те, на що в іншого йде $500, виглядає саме тим, ким він і є - ефективнішим.
👍278🔥5
Рівні автономності AI-агентів, новий SDLC і чому я вирішив піти з SoftServe

Нове відео на ютуб-каналі https://youtu.be/VsH99Ny30as

За три роки розробка з AI пройшла шлях від автодоповнення в Copilot до автономних агентів, які самі імплементують і верифікують задачі.

Імплементація тепер займає хвилини — найскладнішим стало прийняти й перевірити роботу агентів.

А ті, хто не перебудується, просто підуть з ринку.

У відео:
▪️ 4 рівні автономності AI (за свіжим звітом Google)
▪️ новий SDLC, evals і Self-Improving Project Factories
▪️ чому сервісна модель українського IT у зоні ризику
▪️ моя нова AI-native компанія: агентна інженерія під ключ
23👍10🔥4👏1
Про нові моделі

Нещодавно головні гравці на ринку трохи наспамили нових моделей, і бенчмарки по ним вийшли суперечливі - Anthropics заявляє що Opus 5 навіть розумніший за Fable 5, OpenAI переконує що їх GPT 5.6 sol найкращий, а тут ще й китайці з Kimi 3 неочікувано побили всіх по фронтенду (до виходу Opus 5), та й взагалі сильну модель зробили для програмування. Але якщо взяти до уваги не абсолютний інтелект, а співвідношення інтелекту і вартості, то виявляється, що на першому місці взагалі Grok 4.5 (дивимося тут у праву верхню частину).

То що з цим всім робити? Яку модель обирати, кому заносити гроші за токени?

Насправді не все так однозначно, як показують бенчмарки, треба все тестити і підбирати під ваші задачі та, звичайно, бюджети. Це, сподіваюся, всім зрозуміло і так.

А от далеко не кожен знає, що кожна модель по суті має свій специфічний підхід до того, як з неї витягнути найкращий результат? І саме від цього буде залежати, як вона буде справлятися з задачею.

Наприклад, у OpenAI є окремий розділ на сайті, де рекомендації по промптингу наведені по версіям моделей https://developers.openai.com/api/docs/guides/latest-model?model=gpt-5.6
Там просто переключаєте версії і читаєте рекомендації.

Аналогічно у Anthropic, там просто моделі переключаєте у навігації з лівої сторони
https://platform.claude.com/docs/en/build-with-claude/prompt-engineering/prompting-claude-fable-5

Із цікавого - для нових моделей варто переходити від покрокового опису послідовності дій то більш чіткого пояснення того, що ви хочете отримати в результаті. Це як зміна у формулюванні задачі для джуніора та сеньйора - першому ви детально пояснюєте що треба і за чим, а другому - просто говорите що хочете отримати, звертаючи увагу лише на важливі деталі.

Далі обидва вендори, кожен своїми словами, радять по суті одне й те саме: прибрати зайве з промптів. OpenAI навіть наводить цифри зі своїх внутрішніх прогонів evals для кодинг-агента – зменшені системні промпти дали приблизно +10–15% до оцінок, при цьому мінус 41–66% токенів і мінус 33–67% вартості. Anthropic формулює аналогічно: скіли та інструкції, написані під попередні моделі, часто виявляються надто прескриптивними і погіршують результат – їх треба перечитати й повикидати те, що модель тепер робить краще без вас.

Тобто ваша бібліотека промптів і скілів – це не актив назавжди. Це те, що доведеться ревізувати з кожним релізом. Привіт, для тих, хто складав промпти у “бібліотеки”.

Я, до речі, цього ніколи не заохочував і завжди радив конструювати під задачу, особливо гарно працює мета-промптинг.

Зверніть також увагу, що модель видає результат, який дуже залежить від налаштувань міркувань (reasoning, effort - low / medium / high / xhigh і т.п.) У багатьох моделей тепер якість результату буде від цього сильно залежати, ви маєте цей рівень підбирати уважно.

Третє – межі автономії. Загальна рекомендація - заздалегідь визначати, що агент може робити сам (читати файли, дивитися логи, правити код у скоупі, ганяти тести), а що потребує підтвердження (зовнішні записи, деструктивні дії, розширення скоупу). Якщо накидати по всьому промпту «спитай спочатку», «не чіпай», «дочекайся апруву» – модель почне зупинятися там, де не треба, і ви самі собі зробите гірше.

Четверте, і особисто для мене найцікавіше, бо я багато пишу про verification gap. Anthropic рекомендує явну інструкцію: перед тим як звітувати про прогрес, звірити кожне твердження з реальним результатом виклику інструмента, а неперевірене – прямо називати неперевіреним. За їхніми тестами це майже повністю прибирає вигадані звіти про виконану роботу, навіть на задачах, спеціально сконструйованих щоб їх спровокувати. Тобто частина проблеми «агент сказав що зробив, а насправді ні» лікується не лише тулінгом і хуками, а одним абзацом у промпті.
👍238🔥1
П'яте – довгі запуски стають нормою. Anthropic пише, що окремий запит на складній задачі може виконуватися багато хвилин, а автономний запуск – годинами. З цього випливає цілком інженерна робота: таймаути, стрімінг, індикатори прогресу, асинхронна перевірка запусків замість блокуючого очікування, паралельні субагенти й окремі верифікатори зі свіжим контекстом. Плюс зовнішня пам'ять: банальний markdown-файл, куди агент записує висновки з попередніх запусків, дає хороший ефект.

Якщо коротко:
- На бенчмарки дивитеся лише для загального орієнтиру.
- Ганяєте моделі на своїх задачах, за можливості переключаєтеся між ними, виконуєте в паралель щоб побачити що краще працює.
- Для кращого результату - заглянте в гайди промптингу конкретної моделі, підправити промпт/контекст часто спрацьовує краще, ніж змінити модель.
- Думка, що «модель тупіша за попередню» – часто причина в промпті, який був заточений на попередню модель. Перепишіть промпти, спростіть їх і подивіться, чи це допомогло.
- Експериментуйте з режимами міркувань - “слабша” модель з вищим режимом може виявитися дешевшою і кращою, ніж “сильніша”, але з нижчим.

Ну і пам’ятаємо, що промпти/скіли/правила - це все живий артефакт проєкту, який не пишеться один раз, його треба супроводжувати точно як код, а вже скоро - і замість коду :)
👍282🔥1
Як ви знаєте, в мене останнім часом кар’єрні зміни, і одна з причин, чому я на це пішов - тепер можу собі дозволити більше займатися тим, що я люблю робити, зокрема навчати людей, яким це цікаво.

По цьому маю кілька важливих апдейтів:

1. З fwdays запускаємо черговий креш-курс по Агентній інженерії, 5 живих онлайн-занять (+1 заняття опційне), інтенсивно, орієнтовано на людей, що хочуть отримати швидкий результат. Зараз ціна найнижча до 1 серпня, знижки не діють, це Early Birds. Реєстрація та деталі. Я ще закину інфу про курс окремим постом.

2. Активно проводжу корпоративне навчання по Agentic Engineering / AI Assisted розробці - від тривалих програм з нуля, до швидких поглиблених інтенсивів. Працюю з кількома компаніями-клієнтами також веду перемовини з потенційними клієнтами, кепесіті для нових клієнтів ще є, але швидко вичерпується, кому цікаво - не відкладайте, контактуйте.

3. І нарешті - я довго обдумував концепт свого джедайського курсу і нарешті виводжу його на публіку. На відміну від курсів/воркшопів, які роблю з fwdays, це буде тривала програма на рік, без живих занять, учасники будуть рухатися по підручнику з детальним контентом і завданнями у власному темпі, я буду підтримувати в діскорді плюс давати фідбеки до завдань. Зараз запускаю орієнтований на розробників курс по Agentic Engineering СИТХ. Курс недешевий, тому зробив можливість брати в розстрочку монобанку, у такому випадку ціна виходить дуже ок. Для своїх підписників даю знижку 15% (діє лише на оплату одним платежем), купон SITH_FORCE (його треба вставити в поле з коментарем у формі під час оформлення покупки), а ще буде ексклюзивний подарунок - стартер-кіт, який дозволить генерувати сайти в стилі лендингу джедайського курсу.

Купон і подарунок діють до 09 серпня, більше цей подарунок доступний не буде. Лендинг курсу тут
PS. Згодом ще концепт нового джедайського курсу розпишу детальніше, відосик теж запишу.
14👍1😁1
🤔 Платите за AI-інструменти, але більшість роботи все одно робите вручну — бо не знаєте, скільки можна довіряти агенту?
Довірите замало — AI перетворюється на дорогий автодоповнювач. Довірите забагато — отримаєте код, за який соромно на рев'ю. Між цими крайнощами існує ціла система, яку ніхто не пояснив.

🪄 Пройдіть шлях від першого агента-асистента до повністю автономної фабрики проєктів на Crash Course: Agentic Engineering від Fwdays Academy та Вʼячеслава Колдовського!

📅 Старт: 8 вересня
🛠 Формат: 6 онлайн-сесій + практичні домашні завдання
👉 Реєстрація та деталі: https://bit.ly/4b624kr
⚡️До 1 серпня діє ціна Early Birds!

👨‍🏫 Ментор: В'ячеслав Колдовський — Founder Dev AI Consulting. 20+ років в IT, Google Cloud Professional Cloud Architect, керівник Центру Gen AI в IT STEP Університеті.

Результат курсу:
🎯 поступове проходження 6 рівнів довіри до агентів
🎯 власна фабрика проєктів: harness, guardrails і observability, зібрані з нуля на ваших очах
🎯 практика Spec-Driven Development і делегування в Claude Code, Cursor та ChatGPT Codex
🎯 повна трасованість: ви завжди бачите, що агент зробив, чому і скільки це коштувало
🎯 capstone-проєкт із сертифікатом і журналом автономності — артефакт, який можна показати команді

🚀 Не наглядайте за агентами, а навчіться керувати ними разом з Fwdays Academy!
👍74