Przygotowanie danych finansowych do modelu ML: lista kontrolna z wyjaśnieniami
Większość problemów z modelami anomalii zaczyna się nie w algorytmie, lecz w danych. Oto co warto sprawdzić krok po kroku.
Lista kontrolna przygotowania danych
- Sprawdź rozkład klas — w zbiorach finansowych anomalie stanowią zwykle mniej niż 1% rekordów. Model uczący się na takich danych będzie ignorował mniejszość, jeśli nie zastosujesz technik jak SMOTE lub ważenie klas.
- Usuń lub uzupełnij brakujące wartości świadomie — uzupełnianie medianą działa przy danych numerycznych, ale w przypadku dat transakcji lub kategorii merchantów lepiej użyć imputacji opartej na podobnych rekordach.
- Znormalizuj cechy numeryczne — algorytmy takie jak LOF i SVM są wrażliwe na skalę. Kwota 50 000 zł bez normalizacji zdominuje cechę o wartościach od 0 do 10.
- Zakoduj zmienne kategoryczne — kolumny takie jak typ transakcji czy kraj muszą zostać zamienione na liczby. Target encoding sprawdza się lepiej niż one-hot encoding przy dużej liczbie kategorii.
- Utwórz cechy czasowe — godzina transakcji, dzień tygodnia, czas od ostatniej płatności tego samego klienta to informacje, które znacznie poprawiają wykrywalność anomalii.
- Podziel dane chronologicznie — losowy podział train/test zaburza rzeczywistą ocenę modelu. Dane sprzed określonej daty służą do treningu, późniejsze do testu.
Narzędzia pomocnicze
Biblioteka imbalanced-learn obsługuje techniki radzenia sobie z nierównomiernymi zbiorami. Feature-engine automatyzuje wiele kroków inżynierii cech opisanych powyżej.
Materiał przygotowany przez zespół analityczny Vividwmint. Treści mają charakter informacyjny i nie stanowią porady inwestycyjnej. Wyniki historyczne nie gwarantują przyszłych rezultatów.
Więcej analiz i komentarzy
Vividwmint publikuje regularne analizy dotyczące zastosowania algorytmów w zarządzaniu portfelem. Każdy materiał opiera się na danych, nie na prognozach.
komunikaty prasowe →