Andmekaeve üheks tehnikaks on prognoosiv analüüs regressioonmudeli hindamise abil, mille käigus otsitakse sõltuva tunnuse modelleerimiseks sobivaid tunnuseid suurtest andmehulkadest.
Kuid suurte andmehulkade läbiproovimisel on ka vigade tõenäosus suur.
Ette on võetud tunnuse z väärtuste komplekt ning lineaarse mudeli y=5+10z + u abil on genereeritud sõltuva tunnuse y väärtused. Seejärel on sõltumatult
genereeritud 20 tunnust x1 kuni x20, mida y väärtuste genereerimisel ei kasutatud, ning hinnatakse regressioonmudelit iga sellise tunnuse korral.
Iga kord leitakse vastava seletava tunnuse xk olulisuse tõenäosus. Antud juhul on teada, et iga tunnuse x1 kuni x20 korral kehtib nullhüpotees,
st vastav tunnus ei mõjuta funktsioontunnuse y väärtusi. Siiski juhtub, et mõne tunnuse korral tuleb olulisuse tõenäosus väiksem kui 0,05
ja nullhüpotees on ümber lükatud ning järelduseks on, et vastav tunnus mõjutab tunnust y.
