Росстандарт утвердил предварительные национальные стандарты (ПНСТ) по синтезу данных, разработанные Ассоциацией больших данных при участии профильных экспертов и представителей рынка. Документы формируют методологическую основу с едиными правилами синтеза данных и прозрачными критериями оценки результата синтеза.
Новая серия стандартов охватывает такие ключевые элементы работы с синтетическими данными, как: закрепление базовых положений и терминологии, описание архитектуры процесса и методов синтеза, требования к описанию результатов и методике оценки качества.
С 1 сентября 2026 года ПНСТ «Синтез данных. Основные положения», «Синтез данных. Архитектура процесса синтеза данных. Методы синтеза» и «Синтез данных. Описание результатов процесса синтеза. Методика оценки качества» переведут технологию синтетических данных из категории экспериментальных практик в статус формализованного инструмента для разработчиков цифровых решений, бизнеса и государства.
Ниже представлен краткий обзор кейсов, подробный разбор которых доступен в разделе «Практическое обоснование ПНСТ "Синтез данных"».
Синтетические данные для маркетингового касания
| Параметр | Описание |
| Организация | Ассоциация больших данных / HFLabs |
| Отрасль | Маркетинг, управление взаимоотношениями с клиентами |
| Цель синтеза и исходный набор данных |
Генерация синтетических клиентских профилей для безопасной передачи маркетинговым подрядчикам и партнёрам с целью: планирования маркетинговых кампаний, сегментации целевой аудитории, тестирования воронок конверсии, оценки эффективности каналов привлечения. Исходные данные: CRM-данные оператора (демографические, поведенческие, транзакционные характеристики клиентов, история маркетинговых касаний). |
| Архитектура системы синтеза и бюджет приватности |
Предлагаемый подход: маргинальный метод (MST/AIM) для структурированных атрибутов + DP-калиброванная генерация временных последовательностей касаний. Бюджет приватности: ε ∈ [1, 10] (рабочий диапазон), единица приватности - клиент. Возможна интеграция метрической приватности (Metric DP) для географических атрибутов. |
| Протокол синтезирования |
1) Профилирование реального набора данных: типы атрибутов, распределения, корреляции. 2) Выбор оптимальных k-мерных маргиналов через экспоненциальный механизм. 3) Внесение гауссова шума в выбранные маргиналы. 4) Генерация синтетических записей через вероятностную графовую модель (PGM). 5) Постобработка: обеспечение согласованности и бизнес-правил. 6) Валидация: статистические метрики + стресс-тестирование. |
| Результирующий набор данных и метрики |
Синтетические клиентские профили с сохранением: распределения по сегментам, корреляций между атрибутами, паттернов маркетинговых касаний. Целевые метрики: сохранение полезности для задач сегментации ≥ 85%, KS-расстояние по ключевым атрибутам ≤ 0,1. |
| Стресс-тестирование | Атака членства (membership inference), оценка CVPL (Correct attribution Probability for the Linkage risk), атрибутная атака на чувствительные признаки. |
| Потенциал | Возможность безопасной передачи данных подрядчикам без нарушения требований 152-ФЗ. Ускорение цикла подготовки маркетинговых кампаний. Снижение регуляторных рисков. |
Синтетические данные резюме для платформы подбора персонала
| Параметр | Описание |
| Организация | Ассоциация больших данных / HeadHunter |
| Отрасль | Подбор персонала, рекрутинг |
| Цель синтеза и исходный набор данных |
Генерация синтетических резюме для задач: безопасное тестирование алгоритмов подбора, обучение моделей машинного обучения без использования реальных данных кандидатов, оценка справедливости (fairness) алгоритмов, обмен данными с третьими сторонами. Исходные данные: база резюме (~160 000 записей, 45+ атрибутов: ФИО, контакты, образование, опыт работы, навыки, ожидания по заработной плате). |
| Архитектура системы синтеза и бюджет приватности |
Многоэтапный конвейер: (а) структурированные атрибуты - маргинальный метод (MST/AIM) с DP; (б) текстовые атрибуты (описания опыта, навыки) - генерация на основе базовой модели (LLM) с DP-отбором; (в) связи между атрибутами - обеспечение когерентности (должность ↔ навыки ↔ образование ↔ опыт). Бюджет приватности: ε ∈ [4, 12], единица приватности - кандидат. Дополнительно: специальные политики для групп риска (уникальные должности, редкие специализации). |
| Протокол синтезирования (предлагаемый) |
1) Профилирование набора данных: выявление квази-идентификаторов, построение корреляционных матриц. 2) Разделение атрибутов на группы: структурированные, текстовые, вспомогательные. 3) Генерация структурированного каркаса (демографические данные, должности, уровни). 4) Генерация текстового содержимого на основе каркаса с применением LLM и DP-отбора. 5) Обеспечение семантической когерентности (должность ↔ навыки ↔ образование). 6) Постобработка и валидация. Количество итераций: 3–5 для каждого этапа рафинирования. |
| Результирующий набор данных и метрики (целевые) |
Синтетические резюме, сохраняющие: распределение по должностям, уровням квалификации, регионам, возрастным группам; статистические свойства зарплатных ожиданий; структуру навыков и их корреляцию с опытом. На основе опыта проекта обезличивания HeadHunter: целевой риск идентификации 1–7%, сохранение полезности 75–85%. |
| Стресс-тестирование | 4 типа атак: атака связи (Linkage), оценка CVPL, атака членства (Membership inference), темпоральные атаки. Метрики качества: KS-расстояние, коэффициент Жаккара, ML-полезность (обучение моделей подбора на синтетических данных, тестирование на реальных). |
| Потенциал | Безопасное тестирование и разработка алгоритмов подбора персонала. Обмен данными с партнёрами без нарушения требований 152-ФЗ. Оценка справедливости алгоритмов без доступа к реальным данным кандидатов. |
Трёхстороннее федеративное обнаружение мошенничества (3WAY Anti-Fraud)
| Параметр | Описание |
| Организация | Ассоциация больших данных |
| Отрасль | Финансовый сектор, телекоммуникации, платёжные системы |
| Цель синтеза и исходный набор данных |
Обнаружение межканального мошенничества, требующего объединения данных трёх участников (банк, оператор связи, платёжная система), без раскрытия данных каждого участника остальным. Типовые сценарии: подмена SIM-карты → перехват управления счётом → несанкционированный платёж; несоответствие геолокации; социальная инженерия. |
| Архитектура системы синтеза и бюджет приватности |
Четырёхфазная гибридная архитектура: фаза 1 - независимая симуляция (ε = 0, публичные данные); фаза 2 - синтетическая связка по искусственным идентификаторам (ε = 0); фаза 3 - последовательное DP-рафинирование каждым участником только своих атрибутов; фаза 4 - обеспечение межотраслевой согласованности (постобработка, без дополнительного расхода бюджета). Каждый участник рафинирует только собственные данные. Суммарный бюджет: ε_total через RDP-композицию. |
| Протокол синтезирования (предлагаемый) | Фаза 1: Каждый участник генерирует начальный синтетический набор на основе публичных данных (статистики ЕЦБ, параметры Базель III, типологии ФАТФ, статистики МСЭ). Фаза 2: Реестр синтетических идентификаторов связывает три набора. Фаза 3: Последовательные раунды рафинирования условных маргиналов. Фаза 4: Обеспечение временной, географической и финансовой согласованности. |
| Результирующий набор данных и метрики (целевые) | Трёхсторонний синтетический набор данных с размеченными сценариями межканального мошенничества. |
| Стресс-тестирование | Анализ поверхности атаки: утечка через рафинирование, утечка через связку, утечка через согласованность. Формальная (ε, δ)-DP гарантия для каждого участника. |
| Потенциал | Возможность совместного обнаружения мошенничества без раскрытия данных участников. Уникальное позиционирование в сегменте федеративной аналитики. |