ETSI публикува техническия доклад TR 104 180, който дефинира 18 метрики за измерване на качеството на данните. Той предоставя на компаниите начин да проверят дали техните данни са достатъчно качествени за използване в системи с изкуствен интелект (ИИ), преди да ги приложат на практика. Докладът определя всяка метрика и включва формулите, необходими за нейното изчисляване.

Метриките са разделени в четири основни групи:

  • Основни показатели: проверяват дали данните са пълни, точни, съгласувани и без дубликати.
  • Използваемост: определя дали данните са налични при необходимост, достатъчно добре документирани за проследяване до техния източник и актуални.
  • Справедливост (Fairness): анализира дали данните третират равнопоставено различните групи хора.
  • Поверителност: проверява дали лицата в данните могат да бъдат идентифицирани и дали чувствителната информация е защитена.

„От съществено значение е качеството на данните да бъде измеримо, особено за организации, които трябва да установят дали техните данни са подходящи за критични цели, какъвто е случаят с надеждния изкуствен интелект“, заяви Диего Лопес, председател на техническия комитет DATA към ETSI.

„Стандартизираните метрики на ETSI осигуряват общ език за оценка на качеството на данните, предоставяйки количествени доказателства за това дали даден набор от данни е подходящ за предназначението си. Това поставя важна основа за по-последователни и повторими подходи към оценката на качеството с напредъка на ИИ и технологиите, базирани на данни“, добави Лопес.

За да тестват метриките, изследователите зад TR 104 180 са ги приложили върху два публични набора от данни. Единият е съдържал показания от сензори на самолетни двигатели, а другият — данни от преброяването на населението в САЩ, традиционно използвани в изследванията на машинното обучение за прогнозиране дали дадено лице печели над 50 000 долара годишно.

Данните от самолетните двигатели са се представили добре — те са били пълни, точни и стабилни във времето. Данните от преброяването обаче са предизвикали сериозни опасения.

Изследователите са анализирали данните от преброяването за наличие на предубеденост между мъжете и жените. Около 31 процента от мъжете в набора от данни са били отбелязани като лица с високи доходи, в сравнение с едва около 11 процента от жените. Тази разлика е почти трикратна, което според TR 104 180 се третира като предупредителен сигнал за наличие на дискриминация/предубеденост.

Два проблема с поверителността в един набор от данни

Данните от преброяването не са преминали успешно и проверките за поверителност по два отделни начина:

  • Комбинирането на само четири детайла — възраст, раса, пол и държава — е било достатъчно за еднозначно идентифициране на конкретни хора в набора от данни. Възможността отделни лица да бъдат разкрити самостоятелно се отчита в доклада като сериозен риск.
  • При проверка дали чувствителните полета са защитени, изследователите са открили лични данни, съхранявани в некриптиран чист текст (plain text), без приложена маска или криптиране.

TR 104 180 разглежда и двете констатации като дефекти в качеството на данните. Анонимността и поверителността фигурират в същия списък като точността и пълнотата и се оценяват с аналогични формули.

Докладът TR 104 180 е разработен съвместно с работна група, включваща Университета Седжонг, EGM, TTA, Университета Даеджеон и CNIT. Екипът е създал и инструмент с отворен код, който оценява всеки набор от данни спрямо 18-те метрики.