Що означає FAIR

FAIR-дані - це дані, підготовлені за принципами Findable (знаходжувані), Accessible (доступні), Interoperable (сумісні) та Reusable (придатні до повторного використання). Йдеться не просто про публікацію файлів у мережі, а про таку організацію даних, метаданих, форматів і правил доступу, яка дозволяє людям і системам легко їх знаходити, інтерпретувати та використовувати повторно.

У класичному формулюванні принципів FAIR (Wilkinson et al., 2016) окремо наголошено на machine-actionability - здатності інформаційних систем автоматично знаходити, отримувати, інтегрувати й повторно використовувати (мета)дані з мінімальним втручанням людини.

Джерела: FAIR Guiding Principles for scientific data management and stewardship (Scientific Data, 2016), GO FAIR: FAIR Principles.

Чому це важливо

У сучасній науці недостатньо лише зберегти набір даних. Важливо, щоб через рік, п'ять або десять років дослідники могли зрозуміти, що саме містить набір, за яких умов він був створений, хто його автор, які є обмеження доступу та як його правильно цитувати. FAIR-підхід зменшує ризик втрати контексту, підвищує довіру до результатів дослідження та спрощує обмін даними між установами, репозитаріями та інформаційними системами.

Офіційні підпринципи FAIR (F1-R1.3)

Нижче подано стислий академічний огляд підпринципів, що використовуються в GO FAIR і в оригінальній публікації 2016 року.

Код Коротке формулювання
F1(Мета)дані мають глобально унікальний і постійний ідентифікатор.
F2Дані описані багатими, релевантними метаданими.
F3Метадані явно містять ідентифікатор даних, які вони описують.
F4(Мета)дані зареєстровані або проіндексовані в ресурсі з пошуком.
A1(Мета)дані отримуються за ідентифікатором через стандартизований протокол.
A1.1Протокол є відкритим, безоплатним і універсально реалізовним.
A1.2Протокол підтримує автентифікацію та авторизацію за потреби.
A2Метадані лишаються доступними навіть якщо самі дані недоступні.
I1(Мета)дані використовують формальну й загальноприйняту мову представлення знань.
I2(Мета)дані використовують словники, що самі відповідають FAIR.
I3(Мета)дані містять кваліфіковані посилання на інші (мета)дані.
R1(Мета)дані детально описані набором точних і релевантних атрибутів.
R1.1Є чітка та доступна ліцензія на використання даних.
R1.2Забезпечено детальне provenance (походження) даних.
R1.3Дотримано доменно релевантних стандартів спільноти.

Офіційні пояснення за кожним підпринципом наведено на сторінці GO FAIR: FAIR Principles.

Принцип 1. Findable - дані мають легко знаходитися

Дані повинні мати зрозумілий опис і стійкий ідентифікатор, щоб їх можна було швидко знайти через пошук, каталог або репозитарій.

  • Набір даних повинен мати унікальний постійний ідентифікатор, наприклад DOI або Handle
  • Метадані мають бути достатньо повними: назва, автори, дата, тема, ключові слова, опис, версія
  • Метадані мають чітко містити ідентифікатор набору даних, який вони описують (відповідність F3)
  • Дані та метадані повинні індексуватися пошуковими системами та внутрішнім пошуком репозитарію
  • Назви файлів, колекцій і записів мають бути логічними й послідовними

Принцип 2. Accessible - дані мають бути доступними

Доступність не означає, що всі дані повинні бути відкритими без обмежень. Це означає, що користувач повинен розуміти, як отримати доступ до даних, а система повинна підтримувати надійний і стандартний спосіб їх надання.

  • Дані й метадані мають бути доступні через стабільні протоколи, наприклад HTTPS, OAI-PMH або API
  • Комунікаційний протокол має бути відкритим, безоплатним і універсально реалізовним (A1.1)
  • Для чутливих даних мають бути передбачені процедури автентифікації й авторизації (A1.2)
  • Навіть якщо самі файли обмежені, метадані бажано залишати відкритими для пошуку та цитування
  • Метадані повинні залишатися доступними навіть тоді, коли файл або набір більше недоступний (A2)
  • Потрібно чітко вказувати умови доступу: відкритий доступ, ембарго, доступ за запитом, локальні обмеження
  • Сторінка набору даних повинна містити контакт або інструкцію для отримання доступу, якщо він обмежений

Принцип 3. Interoperable - дані мають бути сумісними

Щоб дані могли обмінюватися між різними платформами та інструментами, вони повинні бути описані за допомогою зрозумілих стандартів, контрольованих словників і поширених форматів.

  • Бажано використовувати відкриті та добре документовані формати, наприклад CSV, JSON, XML, TIFF, PDF/A
  • (Мета)дані мають використовувати формальну, доступну та загальноприйняту мову представлення знань (I1)
  • Метадані мають базуватися на визнаних схемах, наприклад Dublin Core, DataCite, MODS або інших профільних стандартах
  • Імена організацій, авторів, тем та типів ресурсів бажано пов'язувати з авторитетними довідниками й тезаурусами, що відповідають FAIR (I2)
  • Слід додавати кваліфіковані зв'язки з іншими об'єктами: статтями, програмним кодом, грантами, інструментами, версіями (I3)
  • Дані повинні бути придатні до обробки не лише людиною, але й машиною

Принцип 4. Reusable - дані мають бути придатними до повторного використання

Дані приносять найбільшу користь тоді, коли інші дослідники можуть коректно інтерпретувати, перевірити та повторно використати їх у нових дослідженнях.

  • Необхідно вказувати ліцензію на використання, наприклад Creative Commons, або інші умови повторного використання
  • Слід документувати походження даних: методику збору, використані інструменти, версію програмного забезпечення, зміни та очищення
  • Важливо публікувати супровідні файли: readme, codebook, словники змінних, інструкції з інтерпретації
  • Опис і формат мають відповідати доменно релевантним стандартам наукової спільноти (R1.3)
  • Якість метаданих і контексту часто важливіша за сам факт завантаження файлу в репозитарій

Що потрібно для FAIR-публікації на практиці

  • Вибрати репозитарій, який підтримує постійні ідентифікатори, метадані, індексацію і стабільні посилання
  • Налаштувати обов'язкові поля метаданих для наборів даних
  • Визначити правила іменування файлів, версій та колекцій
  • Використовувати відкриті формати там, де це можливо
  • Вказувати ліцензії, авторів, установу, грант, пов'язані публікації та контакти
  • Забезпечити інтеграцію з DOI, ORCID, DataCite, OAI-PMH та іншими сервісами обміну метаданими

Як DSpace і Dataverse допомагають працювати з FAIR-даними

DSpace і Dataverse можуть бути основою для реалізації FAIR-підходу в університеті, науковій установі або дослідницькому проєкті. Такі системи допомагають не лише зберігати файли, але й організовувати їхній опис, доступ, цитування та довгострокове використання.

  • DSpace добре підходить для інституційних репозитаріїв, де важливі колекції, політики доступу, інтеграції та керування метаданими
  • Dataverse особливо зручний для публікації дослідницьких наборів даних, версій, цитування та роботи з data-centric workflows
  • Інтеграція DSpace і Dataverse дозволяє поєднати репозитарій публікацій і окреме середовище для наборів даних
  • Правильне налаштування метаданих, ліцензій і доступу робить обидві платформи корисним інструментом для впровадження FAIR-принципів

Типові помилки

  • Публікація лише архіву без опису його вмісту
  • Відсутність ліцензії або незрозумілі умови використання
  • Збереження даних лише у закритому або малопоширеному форматі
  • Неповні метадані без авторів, дати, методики чи ключових слів
  • Відсутність зв'язку між набором даних і пов'язаною статтею, проєктом або грантом
  • Використання локальних скорочень і назв, незрозумілих для зовнішніх користувачів

Підсумок

FAIR-дані - це не окремий формат і не одна технологія, а практичний підхід до підготовки, опису, зберігання та публікації дослідницьких даних. Якщо дані легко знайти, отримати, прочитати іншими системами та повторно використати з чітким контекстом, вони значно краще працюють на науку, установу та спільноту.

Потрібно встановити DSpace або Dataverse?

Допоможемо налаштувати метадані, структуру репозитарію, політики доступу та інтеграцію DSpace або Dataverse

Написати нам