Автор и репозиторий
Автор — Affaan M.. Репозиторий собрал 220k звёзд на GitHub. Распространяется под лицензией MIT. Файл benchmark-methodology.md открыт: прочитать его можно до установки.
Открыть репозиторийКак построить честный тест для ИИ-системы и не обмануть себя.
Методика измерения качества ИИ-систем и агентов: по каким критериям оценивать, как собрать проверочный набор данных, какие метрики брать и как сделать результат воспроизводимым. Отдельно разбирается утечка данных — ситуация, когда модель уже видела то, на чём вы её проверяете, и оценка получается завышенной. Если вы обучаете модели, соберёте честный пайплайн проверки. Если отвечаете за ИИ-функцию в продукте, поймёте, как измерить её качество цифрами, а не ощущением «вроде отвечает лучше».
Автор — Affaan M.. Репозиторий собрал 220k звёзд на GitHub. Распространяется под лицензией MIT. Файл benchmark-methodology.md открыт: прочитать его можно до установки.
Открыть репозиторийСклонируйте репозиторий в ~/.claude/skills/ и перезапустите Claude Code — скилл подхватится сам. Дальше просто попросите ассистента использовать «Benchmark Methodology».
Скопируйте содержимое SKILL.md в системные правила проекта. Скиллы не запускают код — это текстовые инструкции, которые меняют поведение модели.
Подберу скиллы под вашу задачу, поставлю и покажу на живом примере — быстрее, чем читать документацию.
Получить консультациюАнализ данных, пайплайны, ML, интеграция LLM в продукты.
Ко всем скиллам категорииПромпт, токен, MCP, агент — 44 понятия простыми словами, если что-то на этой странице звучит незнакомо.
Открыть словарьПошаговые разборы: от первого промпта до своих агентов и автоматизации.
К каталогу гайдовНапишите, чем занимаетесь, — скажу, закроет ли задачу этот скилл или собрать решение под вас.
Получить консультациюПн–Вс, 10:00–20:00. Отвечаю лично.