Серия ПНСТ «Синтез данных»

Росстандарт утвердил предварительные национальные стандарты (ПНСТ) по синтезу данных, разработанные Ассоциацией больших данных при участии профильных экспертов и представителей рынка. Документы формируют методологическую основу с едиными правилами синтеза данных и прозрачными критериями оценки результата синтеза.

Новая серия стандартов охватывает такие ключевые элементы работы с синтетическими данными, как: закрепление базовых положений и терминологии, описание архитектуры процесса и методов синтеза, требования к описанию результатов и методике оценки качества.

С 1 сентября 2026 года ПНСТ «Синтез данных. Основные положения», «Синтез данных. Архитектура процесса синтеза данных. Методы синтеза» и «Синтез данных. Описание результатов процесса синтеза. Методика оценки качества» переведут технологию синтетических данных из категории экспериментальных практик в статус формализованного инструмента для разработчиков цифровых решений, бизнеса и государства.

Обзор кейсов применения синтеза данных с обеспечением приватности

Ниже представлен краткий обзор кейсов, подробный разбор которых доступен в разделе «Практическое обоснование ПНСТ "Синтез данных"».

Синтетические данные для маркетингового касания

Параметр Описание
Организация Ассоциация больших данных / HFLabs
Отрасль Маркетинг, управление взаимоотношениями с клиентами
Цель синтеза и исходный набор данных Генерация синтетических клиентских профилей для безопасной передачи маркетинговым подрядчикам и партнёрам с целью: планирования маркетинговых кампаний, сегментации целевой аудитории, тестирования воронок конверсии, оценки эффективности каналов привлечения.

Исходные данные: CRM-данные оператора (демографические, поведенческие, транзакционные характеристики клиентов, история маркетинговых касаний).
Архитектура системы синтеза и бюджет приватности Предлагаемый подход: маргинальный метод (MST/AIM) для структурированных атрибутов + DP-калиброванная генерация временных последовательностей касаний.

Бюджет приватности: ε ∈ [1, 10] (рабочий диапазон), единица приватности - клиент. Возможна интеграция метрической приватности (Metric DP) для географических атрибутов.
Протокол синтезирования 1) Профилирование реального набора данных: типы атрибутов, распределения, корреляции.
2) Выбор оптимальных k-мерных маргиналов через экспоненциальный механизм.
3) Внесение гауссова шума в выбранные маргиналы.
4) Генерация синтетических записей через вероятностную графовую модель (PGM).
5) Постобработка: обеспечение согласованности и бизнес-правил.
6) Валидация: статистические метрики + стресс-тестирование.
Результирующий набор данных и метрики Синтетические клиентские профили с сохранением: распределения по сегментам, корреляций между атрибутами, паттернов маркетинговых касаний.

Целевые метрики: сохранение полезности для задач сегментации ≥ 85%, KS-расстояние по ключевым атрибутам ≤ 0,1.
Стресс-тестирование Атака членства (membership inference), оценка CVPL (Correct attribution Probability for the Linkage risk), атрибутная атака на чувствительные признаки.
Потенциал Возможность безопасной передачи данных подрядчикам без нарушения требований 152-ФЗ. Ускорение цикла подготовки маркетинговых кампаний. Снижение регуляторных рисков.

Синтетические данные резюме для платформы подбора персонала

Параметр Описание
Организация Ассоциация больших данных / HeadHunter
Отрасль Подбор персонала, рекрутинг
Цель синтеза и исходный набор данных Генерация синтетических резюме для задач: безопасное тестирование алгоритмов подбора, обучение моделей машинного обучения без использования реальных данных кандидатов, оценка справедливости (fairness) алгоритмов, обмен данными с третьими сторонами.

Исходные данные: база резюме (~160 000 записей, 45+ атрибутов: ФИО, контакты, образование, опыт работы, навыки, ожидания по заработной плате).
Архитектура системы синтеза и бюджет приватности Многоэтапный конвейер: (а) структурированные атрибуты - маргинальный метод (MST/AIM) с DP;
(б) текстовые атрибуты (описания опыта, навыки) - генерация на основе базовой модели (LLM) с DP-отбором;
(в) связи между атрибутами - обеспечение когерентности (должность ↔ навыки ↔ образование ↔ опыт).

Бюджет приватности: ε ∈ [4, 12], единица приватности - кандидат. Дополнительно: специальные политики для групп риска (уникальные должности, редкие специализации).
Протокол синтезирования (предлагаемый) 1) Профилирование набора данных: выявление квази-идентификаторов, построение корреляционных матриц.
2) Разделение атрибутов на группы: структурированные, текстовые, вспомогательные.
3) Генерация структурированного каркаса (демографические данные, должности, уровни).
4) Генерация текстового содержимого на основе каркаса с применением LLM и DP-отбора.
5) Обеспечение семантической когерентности (должность ↔ навыки ↔ образование).
6) Постобработка и валидация. Количество итераций: 3–5 для каждого этапа рафинирования.
Результирующий набор данных и метрики (целевые) Синтетические резюме, сохраняющие: распределение по должностям, уровням квалификации, регионам, возрастным группам; статистические свойства зарплатных ожиданий; структуру навыков и их корреляцию с опытом.

На основе опыта проекта обезличивания HeadHunter: целевой риск идентификации 1–7%, сохранение полезности 75–85%.
Стресс-тестирование 4 типа атак: атака связи (Linkage), оценка CVPL, атака членства (Membership inference), темпоральные атаки. Метрики качества: KS-расстояние, коэффициент Жаккара, ML-полезность (обучение моделей подбора на синтетических данных, тестирование на реальных).
Потенциал Безопасное тестирование и разработка алгоритмов подбора персонала. Обмен данными с партнёрами без нарушения требований 152-ФЗ. Оценка справедливости алгоритмов без доступа к реальным данным кандидатов.

Трёхстороннее федеративное обнаружение мошенничества (3WAY Anti-Fraud)

Параметр Описание
Организация Ассоциация больших данных
Отрасль Финансовый сектор, телекоммуникации, платёжные системы
Цель синтеза и исходный набор данных Обнаружение межканального мошенничества, требующего объединения данных трёх участников (банк, оператор связи, платёжная система), без раскрытия данных каждого участника остальным.
Типовые сценарии:
подмена SIM-карты → перехват управления счётом →
несанкционированный платёж;
несоответствие геолокации;
социальная инженерия.
Архитектура системы синтеза и бюджет приватности Четырёхфазная гибридная архитектура:
фаза 1 - независимая симуляция (ε = 0, публичные данные);
фаза 2 - синтетическая связка по искусственным идентификаторам (ε = 0);
фаза 3 - последовательное DP-рафинирование каждым участником только своих атрибутов;
фаза 4 - обеспечение межотраслевой согласованности (постобработка, без дополнительного расхода бюджета). Каждый участник рафинирует только собственные данные. Суммарный бюджет: ε_total через RDP-композицию.
Протокол синтезирования (предлагаемый) Фаза 1: Каждый участник генерирует начальный синтетический набор на основе публичных данных (статистики ЕЦБ, параметры Базель III, типологии ФАТФ, статистики МСЭ). Фаза 2: Реестр синтетических идентификаторов связывает три набора. Фаза 3: Последовательные раунды рафинирования условных маргиналов. Фаза 4: Обеспечение временной, географической и финансовой согласованности.
Результирующий набор данных и метрики (целевые) Трёхсторонний синтетический набор данных с размеченными сценариями межканального мошенничества.
Стресс-тестирование Анализ поверхности атаки: утечка через рафинирование, утечка через связку, утечка через согласованность. Формальная (ε, δ)-DP гарантия для каждого участника.
Потенциал Возможность совместного обнаружения мошенничества без раскрытия данных участников. Уникальное позиционирование в сегменте федеративной аналитики.