Серия ПНСТ «Синтез данных»

Серия предварительных национальных стандартов по синтезу данных разработана АБД при участии профильных экспертов и представителей рынка и утверждена Росстандартом.

Документы охватывают ключевые элементы работы с синтетическими данными: закрепление базовых положений и терминологии, описание архитектуры процесса и методов синтеза, требования к описанию результатов и методике оценки качества. В совокупности это формирует единые правила и прозрачные критерии, создавая для рынка методологическую основу для внедрения синтетических данных в корпоративную и отраслевую практику.

С 1 сентября 2026 года ПНСТ 1064‑2026, 1065‑2026 и 1066‑2026 переведут технологию синтетических данных из категории экспериментальных практик в статус формализованного инструмента для бизнеса, государства и разработчиков цифровых решений.

Обзор кейсов применения синтеза данных с обеспечением приватности

Синтетические данные для маркетингового касания

Параметр Описание
Организация Ассоциация больших данных /HFL Lab
Отрасль Маркетинг, управление взаимоотношениями с клиентами
Цель синтеза и исходный набор данных Генерация синтетических клиентских профилей для безопасной передачи маркетинговым подрядчикам и партнёрам с целью: планирования маркетинговых кампаний, сегментации целевой аудитории, тестирования воронок конверсии, оценки эффективности каналов привлечения. Исходные данные: CRM-данные оператора (демографические, поведенческие, транзакционные характеристики клиентов, история маркетинговых касаний).
Архитектура системы синтеза и бюджет приватности Предлагаемый подход: маргинальный метод (MST/AIM) для структурированных атрибутов + DP-калиброванная генерация временных последовательностей касаний. Бюджет приватности: ε ∈ [1, 10] (рабочий диапазон), единица приватности - клиент. Возможна интеграция метрической приватности (Metric DP) для географических атрибутов.
Протокол синтезирования 1) Профилирование реального набора данных: типы атрибутов, распределения, корреляции. 2) Выбор оптимальных k-мерных маргиналов через экспоненциальный механизм. 3) Внесение гауссова шума в выбранные маргиналы. 4) Генерация синтетических записей через вероятностную графовую модель (PGM). 5) Постобработка: обеспечение согласованности и бизнес-правил. 6) Валидация: статистические метрики + стресс-тестирование.
Результирующий набор данных и метрики Синтетические клиентские профили с сохранением: распределения по сегментам, корреляций между атрибутами, паттернов маркетинговых касаний. Целевые метрики: сохранение полезности для задач сегментации ≥ 85%, KS-расстояние по ключевым атрибутам ≤ 0,1.
Стресс-тестирование Атака членства (membership inference), оценка CVPL (Correct attribution Probability for the Linkage risk), атрибутная атака на чувствительные признаки.
Потенциал Возможность безопасной передачи данных подрядчикам без нарушения требований 152-ФЗ. Ускорение цикла подготовки маркетинговых кампаний. Снижение регуляторных рисков.

Синтетические данные резюме для платформы подбора персонала

Параметр Описание
Организация Ассоциация больших данных / HeadHunter
Отрасль Подбор персонала, рекрутинг
Цель синтеза и исходный набор данных Генерация синтетических резюме для задач: безопасное тестирование алгоритмов подбора, обучение моделей машинного обучения без использования реальных данных кандидатов, оценка справедливости (fairness) алгоритмов, обмен данными с третьими сторонами. Исходные данные: база резюме (~160 000 записей, 45+ атрибутов: ФИО, контакты, образование, опыт работы, навыки, ожидания по заработной плате).
Архитектура системы синтеза и бюджет приватности Многоэтапный конвейер: (а) структурированные атрибуты - маргинальный метод (MST/AIM) с DP; (б) текстовые атрибуты (описания опыта, навыки) - генерация на основе базовой модели (LLM) с DP-отбором; (в) связи между атрибутами - обеспечение когерентности (должность ↔ навыки ↔ образование ↔ опыт). Бюджет приватности: ε ∈ [4, 12], единица приватности - кандидат. Дополнительно: специальные политики для групп риска (уникальные должности, редкие специализации).
Протокол синтезирования (предлагаемый) 1) Профилирование набора данных: выявление квази-идентификаторов, построение корреляционных матриц. 2) Разделение атрибутов на группы: структурированные, текстовые, вспомогательные. 3) Генерация структурированного каркаса (демографические данные, должности, уровни). 4) Генерация текстового содержимого на основе каркаса с применением LLM и DP-отбора. 5) Обеспечение семантической когерентности (должность ↔ навыки ↔ образование). 6) Постобработка и валидация. Количество итераций: 3–5 для каждого этапа рафинирования.
Результирующий набор данных и метрики (целевые) Синтетические резюме, сохраняющие: распределение по должностям, уровням квалификации, регионам, возрастным группам; статистические свойства зарплатных ожиданий; структуру навыков и их корреляцию с опытом. На основе опыта проекта обезличивания HeadHunter: целевой риск идентификации 1–7%, сохранение полезности 75–85%.
Стресс-тестирование 4 типа атак: атака связи (Linkage), оценка CVPL, атака членства (Membership inference), темпоральные атаки. Метрики качества: KS-расстояние, коэффициент Жаккара, ML-полезность (обучение моделей подбора на синтетических данных, тестирование на реальных).
Потенциал Безопасное тестирование и разработка алгоритмов подбора персонала. Обмен данными с партнёрами без нарушения требований 152-ФЗ. Оценка справедливости алгоритмов без доступа к реальным данным кандидатов.

Синтетические данные для фармацевтических исследований

Параметр Описание
Организация Ассоциация больших данных / Фарм компания (AZ)
Отрасль Фармацевтика, клинические исследования
Цель синтеза и исходный набор данных Построение обоснования для применения синтетических данных и федеративного обучения в задачах разработки новых лекарственных средств для лечения бронхиальной астмы. Исходные данные: реальные данные о пациентах недоступны для передачи третьим лицам; предлагается работа на основе публичных статистик и синтетических данных. Спецификация включает 30+ переменных (демографические, клинические, функциональные показатели, маркеры воспаления).
Архитектура системы синтеза и бюджет приватности Два подхода: (а) федеративное обучение - модели обучаются локально в медицинских учреждениях, на сервер передаются только обновления параметров; (б) синтетические данные - гибридный подход: правила (аналог Synthea) → генеративная модель → DP-рафинирование.
Протокол синтезирования (предлагаемый) Этап 1: Построение модели на основе публичных клинических руководств и статистик (CDC, ВОЗ, российские клинические рекомендации). Этап 2: Генерация синтетических пациентов по модели прогрессии заболевания. Этап 3 (при наличии доступа к данным): DP-рафинирование маргинальных распределений по данным конкретного учреждения.
Результирующий набор данных и метрики (целевые) Синтетические записи пациентов с бронхиальной астмой, пригодные для предварительного анализа и разработки гипотез.
Стресс-тестирование (планируемое) При использовании только публичных данных: ε = 0. При рафинировании: формальная (ε, δ)-DP гарантия.
Потенциал (ожидаемая) Демонстрация возможности работы с фармацевтическими данными в условиях невозможности прямой передачи данных. Основа для международного позиционирования (канадский, европейский рынки).

Трёхстороннее федеративное обнаружение мошенничества (3WAY Anti-Fraud)

Параметр Описание
Организация Ассоциация больших данных
Отрасль Финансовый сектор, телекоммуникации, платёжные системы
Цель синтеза и исходный набор данных Обнаружение межканального мошенничества, требующего объединения данных трёх участников (банк, оператор связи, платёжная система), без раскрытия данных каждого участника остальным. Типовые сценарии: подмена SIM-карты → перехват управления счётом → несанкционированный платёж; несоответствие геолокации; социальная инженерия.
Архитектура системы синтеза и бюджет приватности Четырёхфазная гибридная архитектура: фаза 1 - независимая симуляция (ε = 0, публичные данные); фаза 2 - синтетическая связка по искусственным идентификаторам (ε = 0); фаза 3 - последовательное DP-рафинирование каждым участником только своих атрибутов; фаза 4 - обеспечение межотраслевой согласованности (постобработка, без дополнительного расхода бюджета). Каждый участник рафинирует только собственные данные. Суммарный бюджет: ε_total через RDP-композицию.
Протокол синтезирования (предлагаемый) Фаза 1: Каждый участник генерирует начальный синтетический набор на основе публичных данных (статистики ЕЦБ, параметры Базель III, типологии ФАТФ, статистики МСЭ). Фаза 2: Реестр синтетических идентификаторов связывает три набора. Фаза 3: Последовательные раунды рафинирования условных маргиналов. Фаза 4: Обеспечение временной, географической и финансовой согласованности.
Результирующий набор данных и метрики (целевые) Трёхсторонний синтетический набор данных с размеченными сценариями межканального мошенничества.
Стресс-тестирование Анализ поверхности атаки: утечка через рафинирование, утечка через связку, утечка через согласованность. Формальная (ε, δ)-DP гарантия для каждого участника.
Потенциал Возможность совместного обнаружения мошенничества без раскрытия данных участников. Уникальное позиционирование в сегменте федеративной аналитики.