Серия предварительных национальных стандартов по синтезу данных разработана АБД при участии профильных экспертов и представителей рынка и утверждена Росстандартом.
Документы охватывают ключевые элементы работы с синтетическими данными: закрепление базовых положений и терминологии, описание архитектуры процесса и методов синтеза, требования к описанию результатов и методике оценки качества. В совокупности это формирует единые правила и прозрачные критерии, создавая для рынка методологическую основу для внедрения синтетических данных в корпоративную и отраслевую практику.
С 1 сентября 2026 года ПНСТ 1064‑2026, 1065‑2026 и 1066‑2026 переведут технологию синтетических данных из категории экспериментальных практик в статус формализованного инструмента для бизнеса, государства и разработчиков цифровых решений.
Синтетические данные для маркетингового касания
| Параметр | Описание |
| Организация | Ассоциация больших данных /HFL Lab |
| Отрасль | Маркетинг, управление взаимоотношениями с клиентами |
| Цель синтеза и исходный набор данных | Генерация синтетических клиентских профилей для безопасной передачи маркетинговым подрядчикам и партнёрам с целью: планирования маркетинговых кампаний, сегментации целевой аудитории, тестирования воронок конверсии, оценки эффективности каналов привлечения. Исходные данные: CRM-данные оператора (демографические, поведенческие, транзакционные характеристики клиентов, история маркетинговых касаний). |
| Архитектура системы синтеза и бюджет приватности | Предлагаемый подход: маргинальный метод (MST/AIM) для структурированных атрибутов + DP-калиброванная генерация временных последовательностей касаний. Бюджет приватности: ε ∈ [1, 10] (рабочий диапазон), единица приватности - клиент. Возможна интеграция метрической приватности (Metric DP) для географических атрибутов. |
| Протокол синтезирования | 1) Профилирование реального набора данных: типы атрибутов, распределения, корреляции. 2) Выбор оптимальных k-мерных маргиналов через экспоненциальный механизм. 3) Внесение гауссова шума в выбранные маргиналы. 4) Генерация синтетических записей через вероятностную графовую модель (PGM). 5) Постобработка: обеспечение согласованности и бизнес-правил. 6) Валидация: статистические метрики + стресс-тестирование. |
| Результирующий набор данных и метрики | Синтетические клиентские профили с сохранением: распределения по сегментам, корреляций между атрибутами, паттернов маркетинговых касаний. Целевые метрики: сохранение полезности для задач сегментации ≥ 85%, KS-расстояние по ключевым атрибутам ≤ 0,1. |
| Стресс-тестирование | Атака членства (membership inference), оценка CVPL (Correct attribution Probability for the Linkage risk), атрибутная атака на чувствительные признаки. |
| Потенциал | Возможность безопасной передачи данных подрядчикам без нарушения требований 152-ФЗ. Ускорение цикла подготовки маркетинговых кампаний. Снижение регуляторных рисков. |
Синтетические данные резюме для платформы подбора персонала
| Параметр | Описание |
| Организация | Ассоциация больших данных / HeadHunter |
| Отрасль | Подбор персонала, рекрутинг |
| Цель синтеза и исходный набор данных | Генерация синтетических резюме для задач: безопасное тестирование алгоритмов подбора, обучение моделей машинного обучения без использования реальных данных кандидатов, оценка справедливости (fairness) алгоритмов, обмен данными с третьими сторонами. Исходные данные: база резюме (~160 000 записей, 45+ атрибутов: ФИО, контакты, образование, опыт работы, навыки, ожидания по заработной плате). |
| Архитектура системы синтеза и бюджет приватности | Многоэтапный конвейер: (а) структурированные атрибуты - маргинальный метод (MST/AIM) с DP; (б) текстовые атрибуты (описания опыта, навыки) - генерация на основе базовой модели (LLM) с DP-отбором; (в) связи между атрибутами - обеспечение когерентности (должность ↔ навыки ↔ образование ↔ опыт). Бюджет приватности: ε ∈ [4, 12], единица приватности - кандидат. Дополнительно: специальные политики для групп риска (уникальные должности, редкие специализации). |
| Протокол синтезирования (предлагаемый) | 1) Профилирование набора данных: выявление квази-идентификаторов, построение корреляционных матриц. 2) Разделение атрибутов на группы: структурированные, текстовые, вспомогательные. 3) Генерация структурированного каркаса (демографические данные, должности, уровни). 4) Генерация текстового содержимого на основе каркаса с применением LLM и DP-отбора. 5) Обеспечение семантической когерентности (должность ↔ навыки ↔ образование). 6) Постобработка и валидация. Количество итераций: 3–5 для каждого этапа рафинирования. |
| Результирующий набор данных и метрики (целевые) | Синтетические резюме, сохраняющие: распределение по должностям, уровням квалификации, регионам, возрастным группам; статистические свойства зарплатных ожиданий; структуру навыков и их корреляцию с опытом. На основе опыта проекта обезличивания HeadHunter: целевой риск идентификации 1–7%, сохранение полезности 75–85%. |
| Стресс-тестирование | 4 типа атак: атака связи (Linkage), оценка CVPL, атака членства (Membership inference), темпоральные атаки. Метрики качества: KS-расстояние, коэффициент Жаккара, ML-полезность (обучение моделей подбора на синтетических данных, тестирование на реальных). |
| Потенциал | Безопасное тестирование и разработка алгоритмов подбора персонала. Обмен данными с партнёрами без нарушения требований 152-ФЗ. Оценка справедливости алгоритмов без доступа к реальным данным кандидатов. |
Синтетические данные для фармацевтических исследований
| Параметр | Описание |
| Организация | Ассоциация больших данных / Фарм компания (AZ) |
| Отрасль | Фармацевтика, клинические исследования |
| Цель синтеза и исходный набор данных | Построение обоснования для применения синтетических данных и федеративного обучения в задачах разработки новых лекарственных средств для лечения бронхиальной астмы. Исходные данные: реальные данные о пациентах недоступны для передачи третьим лицам; предлагается работа на основе публичных статистик и синтетических данных. Спецификация включает 30+ переменных (демографические, клинические, функциональные показатели, маркеры воспаления). |
| Архитектура системы синтеза и бюджет приватности | Два подхода: (а) федеративное обучение - модели обучаются локально в медицинских учреждениях, на сервер передаются только обновления параметров; (б) синтетические данные - гибридный подход: правила (аналог Synthea) → генеративная модель → DP-рафинирование. |
| Протокол синтезирования (предлагаемый) | Этап 1: Построение модели на основе публичных клинических руководств и статистик (CDC, ВОЗ, российские клинические рекомендации). Этап 2: Генерация синтетических пациентов по модели прогрессии заболевания. Этап 3 (при наличии доступа к данным): DP-рафинирование маргинальных распределений по данным конкретного учреждения. |
| Результирующий набор данных и метрики (целевые) | Синтетические записи пациентов с бронхиальной астмой, пригодные для предварительного анализа и разработки гипотез. |
| Стресс-тестирование (планируемое) | При использовании только публичных данных: ε = 0. При рафинировании: формальная (ε, δ)-DP гарантия. |
| Потенциал (ожидаемая) | Демонстрация возможности работы с фармацевтическими данными в условиях невозможности прямой передачи данных. Основа для международного позиционирования (канадский, европейский рынки). |
Трёхстороннее федеративное обнаружение мошенничества (3WAY Anti-Fraud)
| Параметр | Описание |
| Организация | Ассоциация больших данных |
| Отрасль | Финансовый сектор, телекоммуникации, платёжные системы |
| Цель синтеза и исходный набор данных | Обнаружение межканального мошенничества, требующего объединения данных трёх участников (банк, оператор связи, платёжная система), без раскрытия данных каждого участника остальным. Типовые сценарии: подмена SIM-карты → перехват управления счётом → несанкционированный платёж; несоответствие геолокации; социальная инженерия. |
| Архитектура системы синтеза и бюджет приватности | Четырёхфазная гибридная архитектура: фаза 1 - независимая симуляция (ε = 0, публичные данные); фаза 2 - синтетическая связка по искусственным идентификаторам (ε = 0); фаза 3 - последовательное DP-рафинирование каждым участником только своих атрибутов; фаза 4 - обеспечение межотраслевой согласованности (постобработка, без дополнительного расхода бюджета). Каждый участник рафинирует только собственные данные. Суммарный бюджет: ε_total через RDP-композицию. |
| Протокол синтезирования (предлагаемый) | Фаза 1: Каждый участник генерирует начальный синтетический набор на основе публичных данных (статистики ЕЦБ, параметры Базель III, типологии ФАТФ, статистики МСЭ). Фаза 2: Реестр синтетических идентификаторов связывает три набора. Фаза 3: Последовательные раунды рафинирования условных маргиналов. Фаза 4: Обеспечение временной, географической и финансовой согласованности. |
| Результирующий набор данных и метрики (целевые) | Трёхсторонний синтетический набор данных с размеченными сценариями межканального мошенничества. |
| Стресс-тестирование | Анализ поверхности атаки: утечка через рафинирование, утечка через связку, утечка через согласованность. Формальная (ε, δ)-DP гарантия для каждого участника. |
| Потенциал | Возможность совместного обнаружения мошенничества без раскрытия данных участников. Уникальное позиционирование в сегменте федеративной аналитики. |