Capitolul X Data Mining
Data Mining e un proces complex de actualizare a relaţiilor, dependenţelor, asocierilor, modelelor, structurilor, tendinţelor şi claselor prin exploatarea informaţiilor conservate în baza de date folosind metode matematice, statistice sau algoritmice.
Un Data Mining e considerat un proces de prelucrare a datelor elementare disponibile în Data Warehouse cu scopul furnizării de informaţii necesare procesului decizional. În sfera metodelor Data Mining putem identifica atât reţele neuronale sau arbori de decizie cât şi tehnici de vizualizare multidimensionale.
Aplicaţiile pot fi grupate în două categorii :
- Sisteme operaţionale care cuprind ansamblul de activităţi tradiţionale de gestiune ca: gestiunea stocurilor, gestiunea distribuţiei, activitatea de manipulare a dosarelor în administraţie, gestiunea activităţilor bancare. În majoritatea cazurilor procesul se reduce la automatizarea operaţiilor administrative care sunt repetitive.
- Sisteme decizionale care înglobează aplicaţiile ce asigură posibilităţi de diferenţiere la nivel de întreprindere.
Sistemele pot fi grupate în:
- motoare de gestionare a bazelor de date pentru stocarea şi structurarea acestora ;
- instrumente de interogare ;
- tehnologii OLAP pentru analiza multidimensională ;
- metode Data Mining pentru descoperirea cunoştinţelor ascunse în spatele datelor clasice.
Ultimele 3 prezintă diferenţieri atât din punct de vedere al scopului urmărit (analiza elementelor trecute sau previzionarea celor viitoare) cât şi în funcţie de gradul de agregare.
Accesarea datelor in sistemele decizionale se desfăşoară mai mult aleator; interogările folosesc un volum mare de înregistrări. In prezent este destul de greu să se asigure exploatarea aceleiaşi baze de date în scopuri operaţionale şi decizionale.
- Etapele procesului Data Mining
- Identificarea problemei care presupune formularea problemei de rezolvat in condiţiile cunoaşterii datelor detaliate. Pentru o formulare cât mai exacta se procedează la descompunerea în subprobleme cu grad de complexitate redus.
Lansarea unui proces Data Mining presupune în paralel un demers de analiză critică a rezultatelor scontate şi a implicaţiilor acestora în diferite domenii de activitate. De asemenea trebuie identificaţi utilizatorii pentru că nu toate instrumentele oferă aceleaşi facilităţi în interpretare.
- Cautarea datelor se face in 2 faze:
- Investigarea – care presupune selectarea datelor cu sprijinul experţilor în domeniu astfel încât să se determine atributele corespunzătoare pentru descrierea problemei. În aceasta fază se vor clasifica asocierile, se va studia conţinutul şi semantica acestora, se vor identifica valori extreme etc.
- Reducerea dimensiunilor problemei – care presupune observarea corelaţiilor dintre anumite date, corelaţii ce pot genera reducerea numărului de intrări într-un sistem fără însă ca aceasta reducere să fie arbitrara.
3.Selectarea datelor pertinente. O buna modalitate de creare a unui model este identificarea unor evenimente similare. Colectarea şi selectarea datelor pertinente reprezintă pana la 80% din ansamblul de activităţi aferente Data Mining-ului. Analistul trebuie să aleagă între un studiu bazat pe exhaustivitate efectuat pe un eşantion; fiecare sistem are avantaje şi dezavantaje.
- Eliminarea datelor necorespunzătoare se face diferit în funcţie de dimensiunea bazei de date şi de modul de constituire al acesteia, astfel :
- dacă baza de exemple e restrânsa (mai puţin de 300 înregistrări şi mai puţin de 30 variante), iar alimentarea cu date se face automat e mai uşor să verificăm manual şi vizual fiecare înregistrare pentru a descoperi anomaliile. Reprezentările grafice precum histograma sau norul de puncte fac posibilă izolarea elementelor necorespunzătoare .
- dacă baza de exemple e restrânsa şi alimentarea cu date se face manual se va verifica şi coerenţa datelor în momentul încărcării lor.
- dacă baza de exemple e larga şi alimentarea cu date se face manual e posibila introducerea de date identice, costul va creşte şi beneficiile nu vor fi cele scontate.
- dacă baza de date e voluminoasă şi alimentarea cu date se face automat se va trece la identificarea valorilor aberante prin: izolarea valorilor considerate greşite în distribuţiile statistice, construirea unui scor şi identificarea ulterioară prin intermediul indicatorilor statistici etc.
Pentru administrarea datelor care lipsesc putem recurge la :
- excluderea înregistrărilor incomplete;
- înlocuirea valorilor aberante;
- înlăturarea valorilor absente.
Ultima faza a analizei se refera la studiul valorilor nule care pot afecta înregistrările bazei de date.
5.Stabilirea modului de acţiune asupra variabilelor. Datele fiabile si variabilele pertinente vor fi transformate în două moduri:
- Transformarea monovariabilă care se poate realiza prin:
- modificarea unităţii de măsura pentru a evita disproporţiile;
- transformarea logaritmica a variabilei pentru a limita impactul valorilor excepţionale;
- transformarea datelor în durate;
- modificarea coordonatelor asociate datelor geografice prin instrumente speciale care transformă adresele şi elementele aferente acestora în coordonate geografice.
- Transformarea multivariabila care constă în combinarea mai multor variabile elementare şi obţinerea uneia agregate prin metoda:
- ratelor care presupune corelaţia a doi indicatori sub forma de rate;
- frecvenţelor în cadrul căreia măsurarea datelor pentru un interval de timp permite identificarea gradului de repetabilitate a schimburilor;
- tendinţelor înregistrate care presupune studiul evoluţiei în timp a schimburilor urmărind astfel progresul sau regresul înregistrat de anumiţi indicatori;
- combinări liniare si neliniare.
- Cercetarea modelului constă în extragerea cunoştinţelor utile pornind de la un volum mare de date brute care vor fi prezentate într-o forma sintetica. Modelele actuale construite într-o maniera automata au un înalt nivel de interactivitate şi permit interogări din ce in ce mai sugestive:
Plasarea diferitelor tehnici de modelare are în vedere :
- căutarea modelelor bazate pe ecuaţii;
- analiza logică sau descompunerea problemei în subansamble succesive pentru a beneficia de un raţionament structural;
- alegerea tehnicilor de proiectare.
- Evaluarea rezultatului care se poate face din punct de vedere calitativ sau cantitativ. Evaluarea calitativa se face prin reprezentarea grafică a datelor sau conceptual facilitând partajarea cunoştinţelor. Evaluarea cantitativă se face prin indicatori de sinteză care reflectă gradul de încredere şi precizia sondajului.
După construirea modelului se recomandă validarea acestuia prin efectuarea unui test asupra bazei de date, test care să verifice corectitudinea clasărilor.
8.Integrarea cunoştinţelor constă în implantarea modelului şi a rezultatelor sale în sistemul informatic al întreprinderii sau în procesul decizional al acesteia.
Fiecare din etapele prezentate constituie un punct de control în asigurarea calităţii totale a procesului Data Minig.
Tendinţele înregistrate în practica decizională actuală impun integrarea facilităţilor de asistare tip Data Mining la nivelul tuturor stadiilor proiectului.
