Почему средний балл искажает HR-аналитику

На дашборде у подразделения 7 баллов из 10 по системному мышлению. Индикатор зелёный, динамика за год положительная. Руководитель делает понятный вывод: с этой компетенцией всё в порядке.
Теперь посмотрим внутрь данных. В первой команде восемь сотрудников получили по 7 баллов. Во второй четыре человека получили по 10, ещё четыре по 4. Среднее значение одинаковое. Медиана тоже одинаковая. Управленческая ситуация совершенно разная.
Первая команда однородна. Ей может не хватить сильного эксперта для особенно сложной задачи, зато результат не держится на нескольких людях. Во второй есть запас высокой экспертизы и одновременно большая группа ниже допустимого уровня. Если четверых сильных сотрудников распределили по другим проектам, зелёный индикатор ничего не защитит.
Среднее посчитано правильно. Ошибка начинается позже, когда статистическое описание превращают в вывод о готовности людей к работе.
Почему одно число так удобно
Средний балл легко сравнивать между подразделениями и периодами. Его можно вывести на экран, окрасить по порогам и показать руководству без длинного объяснения методики. Для навигации этого достаточно: показатель подсказывает, где посмотреть данные внимательнее.
Но среднее не показывает форму распределения. Оно молчит о доле сотрудников ниже критического уровня, разбросе результатов, выбросах и концентрации компетенции у одного человека. Ещё оно допускает компенсацию, которая в работе может быть невозможна.
Допустим, команда получила 9 баллов по взаимодействию и 5 по работе со сложной информацией. Среднее равно 7. Если её задача состоит в согласовании стандартного процесса, профиль может быть приемлемым. Если люди должны разобрать последствия изменения архитектуры продукта, высокий результат по взаимодействию не восполняет второй показатель.
В статистике эта проблема известна давно. Фрэнсис Энскомб в 1973 году собрал четыре набора данных с почти одинаковыми сводными характеристиками и совершенно разными графиками. В 2017 году Джастин Матейка и Джордж Фицморис развили идею в работе Same Stats, Different Graphs: двенадцать наборов сохраняли одинаковые средние, стандартные отклонения и корреляцию до двух знаков, хотя на графиках образовывали разные фигуры.
HR-данные не рисуют динозавра, как один из примеров Матейки и Фицмориса. Они скрывают более прозаичные вещи: отдел из устойчивых середняков, группу с расколом результатов или одного эксперта, на котором держится функция.
Среднее по людям и среднее по компетенциям ломаются по-разному
Есть два распространённых способа агрегации. В первом случае система усредняет результаты сотрудников по одной компетенции. Так получают показатель подразделения. Во втором она усредняет несколько компетенций одного сотрудника и получает итоговый балл профиля.
Первый способ скрывает распределение людей. Второй скрывает устройство профиля.
Представим должность, для которой критичны анализ информации, принятие решений, делегирование и работа с конфликтом. Два сотрудника получили одинаковый итоговый результат. У одного сильны анализ и решения, но провалено делегирование. У другого нет выраженных провалов, все показатели держатся около среднего уровня.
Назначение зависит от задачи. Для роли руководителя большой команды дефицит делегирования может оказаться стоп-фактором. Для временного аналитического проекта первый сотрудник, наоборот, подходит лучше. Итоговый балл не хранит эту разницу.
Поэтому агрегировать можно только те показатели, между которыми допустима компенсация. Если низкий результат по информационной безопасности нельзя перекрыть сильной коммуникацией, их сумма не должна превращаться в сигнал готовности.
Какие показатели добавить к среднему
Полностью отказываться от среднего значения не нужно. Оно полезно как первая координата. Рядом должны появиться данные, которые отвечают на рабочий вопрос.
Медиана. Она меньше зависит от единичного очень высокого или низкого результата. Правда, пример с двумя командами выше показывает её ограничение: иногда медиана совпадает вместе со средним.
Нижний квартиль. Он помогает увидеть уровень, ниже которого находится четверть группы. Для массового процесса это часто информативнее минимального значения, которое может отражать единичный сбой или ошибку данных.
Доля ниже порога. Если для самостоятельной работы требуется не менее 6 баллов, руководителю нужна доля людей ниже 6. Среднего значения 7 недостаточно. Порог должен появиться из требований роли или задачи. Цветовая шкала, придуманная после оценки, лишь делает отчёт аккуратнее.
Разброс. Разница между сильными и слабыми участниками влияет на формат развития. Однородной группе можно дать общую программу. При широком разбросе часть сотрудников будет скучать, другая не успеет за темпом.
Покрытие критических задач. Здесь единицей анализа становится связка «задача, требование, доступный исполнитель». Если сложные переговоры способен вести только один участник, средний уровень коммуникации по команде вторичен.
Свежесть данных. Результат двухлетней давности после смены роли и руководителя нельзя смешивать с оценкой прошлого месяца без отметки о дате. Система посчитает среднее, даже если половина наблюдений описывает уже другую работу.
Сегментация важнее ещё одного знака после запятой
Среднее по 300 сотрудникам может выглядеть стабильным, потому что внутри него компенсируются разные группы. Руководители первой линии растут, эксперты снижаются. В центральном офисе результат высокий, в двух филиалах низкий. Новички и сотрудники со стажем больше пяти лет отвечают на разные вопросы, но попадают в одну строку.
Добавлять точность до сотых бессмысленно. Сначала данные нужно разрезать по признаку, который связан с решением: роль, уровень, функция, локация, стаж в должности или участие в конкретном процессе. Слишком мелкие группы создают другую проблему. Результат становится нестабильным, а сотрудника иногда можно узнать даже в обезличенном отчёте. Минимальный размер сегмента и правила доступа лучше согласовать до публикации дашборда.
У сегментации есть побочный эффект. Чем больше срезов доступно пользователю, тем легче найти красивое подтверждение уже принятого мнения. Поэтому набор основных срезов стоит закрепить в методике, а нестандартные разрезы отмечать как исследовательские.
Как должен выглядеть полезный экран
Для одной компетенции руководителю обычно хватает небольшой группы показателей:
среднее и медиана;
нижний квартиль и доля ниже рабочего порога;
число сотрудников и дата последней оценки;
разброс по ключевым ролям или подразделениям;
число критических задач без устойчивого покрытия.
Последний пункт нельзя получить простым преобразованием результатов теста. Нужны требования к ролям, карта задач и данные о доступности людей. У сотрудника может быть нужная компетенция, но он уже занят в двух проектах. В статистике профиль закрыт. В календаре компании нет.
Для группового отчёта полезен ещё один режим: показать полосы распределения по уровням без фамилий. Руководитель видит, сколько людей находится ниже требования, рядом с ним и выше. Переход к конкретным сотрудникам должен зависеть от цели оценки и прав доступа.
Проверка качества до публикации показателя
Перед тем как выводить среднее на дашборд, я проверяю несколько вещей. Одинакова ли шкала у всех наблюдений? Относятся ли они к одной роли и периоду? Нет ли пропущенных данных, которые система молча исключила из расчёта? Что означает порог и кто его установил? Может ли высокий результат по одному показателю компенсировать низкий по другому?
Полезно взять два подразделения с близким средним и вручную посмотреть распределения. Если за одинаковыми карточками находятся разные управленческие действия, агрегат нельзя оставлять единственным показателем.
Автоматизация здесь хорошо справляется с расчётами. Она быстро строит сегменты, считает доли, хранит версии профилей и показывает динамику. Но правило интерпретации должен задать человек. Иначе система честно вычислит среднее по данным, которые вообще не следовало складывать.
Бывает, что после увольнения нескольких сотрудников средний балл подразделения растёт. На следующей неделе выясняется, что вместе с одним из ушедших исчез единственный человек, способный закрыть редкую критическую задачу. На дашборде это всё ещё улучшение.
KioskNews shows a cleaned-up reading view extracted from the publisher’s page — the original always lives on their site, not ours.