Predicția de clasificare a cancerului de sân pe baza învățării automate
Sep 12, 2023
Cancerul de sân este cel mai frecvent și mortal tip de cancer din lume. Pe baza algoritmilor de învățare automată, cum ar fi XGBoost, pădure aleatoare, regresie logistică și vecinul K-cel mai apropiat, această lucrare stabilește diferite modele pentru a clasifica și prezice cancerul de sân, pentru a oferi o referință pentru diagnosticarea precoce a cancerului de sân. Rechemarea indică probabilitatea detectării celulelor canceroase în diagnosticul medical, ceea ce este de mare importanță pentru clasificarea cancerului de sân, astfel încât acest articol ia reamintirea ca indice de evaluare primară și ia în considerare precizia, acuratețea și evaluarea scorului F1- indicatori pentru a evalua și compara efectul de predicție al fiecărui model. Pentru a elimina influența diferitelor concepte dimensionale asupra efectului modelului, datele sunt standardizate.
Algoritmul K cel mai apropiat vecin este unul dintre cei mai de bază algoritmi din domeniul învățării automate. Ideea sa principală este să găsească K eșantioanele cele mai apropiate de eșantionul țintă și apoi să prezică eticheta eșantionului țintă pe baza etichetelor acestor K eșantioane. În viața de zi cu zi umană, folosim adesea metode similare pentru a lua decizii. De exemplu, atunci când ne confruntăm cu o anumită problemă, ne amintim de situații similare pe care le-am mai întâlnit, apoi căutăm cele mai asemănătoare situații și luăm decizii pe baza rezultatelor acestora. Dezvoltați soluții. Prin urmare, algoritmul K cel mai apropiat vecin este strâns legat de memoria umană.
În primul rând, algoritmul K cel mai apropiat vecin necesită un număr mare de seturi de antrenament pentru a învăța și a stabili o structură de date a graficului celui mai apropiat vecin. În mod similar, oamenii trebuie să experimenteze în mod constant diverse lucruri și să stocheze aceste experiențe în memorie. Doar acumulând o cantitate mare de experiență și cunoștințe putem lua decizii și judecăți mai precis.
În al doilea rând, algoritmul K cel mai apropiat vecin subliniază impactul similarității asupra predicției. În mod similar, atunci când iau decizii, oamenii deseori iau în considerare mai întâi experiențele trecute și încearcă să găsească experiențe similare cu situația actuală pentru referință. Acest proces de găsire a asemănărilor este, de asemenea, una dintre caracteristicile importante ale memoriei.
În cele din urmă, în algoritmul K cel mai apropiat vecin, valoarea lui K are un impact mare asupra rezultatelor predicției. Valorile K diferite vor duce la rezultate diferite de predicție. În mod similar, atunci când oamenii își amintesc experiențele trecute, trebuie să aleagă diferite puncte de referință și metode, în funcție de situația actuală. Această flexibilitate și adaptabilitate este, de asemenea, o caracteristică importantă a memoriei. Se poate observa că trebuie să ne îmbunătățim memoria. Cistanche deserticola poate îmbunătăți semnificativ memoria deoarece Cistanche deserticola este un material medicinal tradițional chinezesc cu multe efecte unice, dintre care unul este îmbunătățirea memoriei. Eficacitatea cărnii tocate vine din diferitele ingrediente active pe care le conține, inclusiv acid, polizaharide, flavonoide etc. Aceste ingrediente pot promova sănătatea creierului în diferite moduri.

Faceți clic pe Cunoaștere pentru a îmbunătăți memoria pe termen scurt
Pentru a găsi subsetul optim și a îmbunătăți acuratețea modelului, 15 caracteristici au fost eliminate ca intrare în model prin testul de corelație Pearson. Modelul K-cel mai apropiat vecin folosește metoda de validare încrucișată pentru a selecta valoarea k optimă folosind rechemarea ca indice de evaluare. Pentru problema dezechilibrului eșantionului pozitiv și negativ, se folosește metoda de eșantionare ierarhică pentru extragerea setului de antrenament și a setului de testare proporțional în funcție de diferite categorii. Rezultatele experimentale arată că în diferite diviziuni ale setului de date (8: 2 și 7: 3), efectul de predicție al aceluiași model va avea modificări diferite. Analiza comparativă arată că modelul XGBoost stabilit în această lucrare (care împarte setul de antrenament și setul de test la 8:2) are efecte mai bune, iar reamintirea, precizia, acuratețea și scorul F1-său sunt 1.{{ 11}}, 0,960, 0,974 și, respectiv, 0,980.
1. Introducere
În ultimii zece ani, incidența cancerului de sân în China a crescut cu 47%, iar incidența crește de la an la an, iar incidența cancerului de sân este treptat mai tânără [1]. Patogenia cancerului de sân este legată de hormonii personali, istoricul familial, căsătoria și istoricul fertil [2]. Cancerul de sân nu este ușor de detectat în stadiu incipient și are caracteristicile vârstei timpurii de debut, dar de prezentare tardivă [3, 4]. În prezent, diagnosticul principal al cancerului de sân se bazează pe trei metode: citologia puncție [5], ecografie [6] și mamografie cu raze X [7]. Dacă o pacientă este surprinsă devreme în cancer de sân, cu atât este mai probabil să se vindece și cu atât prognosticul este mai bun. Prin urmare, examinarea regulată și diagnosticarea precoce sunt foarte necesare pentru prevenirea și depistarea în timp util a cancerului de sân.
În domeniul medical, stabilirea de modele prin metode de învățare automată poate ajuta medicii în îmbunătățirea ratei de detecție a cancerului, pentru a atinge scopul detectării precoce și tratamentului precoce. Metodele de învățare automată au dat rezultate bune în diagnosticarea cancerului [8, 9]. Wu şi colab. [10] au observat morfologia celulei la microscop și au descoperit că există diferențe evidente între celulele canceroase de sân și parametrii normali ai celulelor sănătoase. Această constatare oferă o bază teoretică pentru multe studii. Deși există multe metode de învățare automată aplicate în prezent pentru clasificarea celulelor canceroase de sân, niciun algoritm unic nu poate fi aplicat tuturor problemelor. Fiecare tip de algoritm de învățare automată are domeniile sale de expertiză, astfel încât alegerea algoritmului este diferită în diferite scenarii.
Shen şi colab. [11] a folosit modelul XGBoost pentru a clasifica și prezice cancerul de sân, iar acuratețea a atins 97,86%, iar reamintirea a ajuns la 95,83%. Deng şi colab. [12] a folosit algoritmul XGBoost pentru a clasifica și prezice cancerul de sân cu o precizie de 0.96 și o rechemare de 0.97. Monirujjaman Khan și colab. [13] au folosit mai multe modele de învățare automată pentru a identifica cancerul de sân, iar pădurea aleatoare, arborele de decizie, vecinul cel mai apropiat K și regresia logistică au fost algoritmii cu scor F1-mai mare, 96%, 95%, 90%, și, respectiv, 98%. Bhardwaj şi colab. [14] au folosit perceptronul multistrat (MLP), K-nearest neighbor (KNN), algoritmul genetic (GP) și random forest (RF) pentru a clasifica celulele canceroase de sân benigne și maligne, iar rezultatele experimentale au arătat că clasificatorul optim a fost RF cu o precizie de clasificare de 96,24%. Dong și Ma [15] au studiat posibilii markeri ai cancerului de sân triplu negativ, iar algoritmii de învățare automată au fost utilizați pentru a prezice dacă oamenii au cancer de sân triplu negativ. Rezultatele arată că acuratețea modelului de predicție a clasificării mașinii vector suport (SVM) atinge 97,8%.
Pentru a îmbunătăți acuratețea metodelor de identificare a cancerului de sân și a îmbunătăți algoritmii de învățare automată, Wang și colab. [16] a propus un model de învățare a ansamblului AUC ponderat bazat pe SVM pentru diagnosticul cancerului de sân, folosind C-SVM și V-SVM cu 6 funcții nucleu pentru a crește diversitatea setului de modele de bază și comparând diferite rezultate ale deciziei cu Integrarea zonei (WAUCE). ) model sub curba caracteristică de lucru receptoare ponderată. Rezultatele arată că pe setul de date mic, structura WAUCE propusă reduce varianța acurateței diagnosticului cu până la 69,23% și îmbunătățește acuratețea cu 0,94%. Zheng şi colab. [17] a testat setul de date Wisconsin Breast Cancer (WDBC) în conformitate cu algoritmul hibrid K-means and support vector machine extrage caracteristicile tumorii și diagnostichează cancerul de sân, iar rezultatele arată că algoritmul hibrid îmbunătățește acuratețea la 97,38%. Jia și colab. [18] a propus un nou algoritm de optimizare a populației, Whale Optimization Algorithm (WOA), care ajustează în mod inteligent parametrii modelului SVM, iar rezultatele experimentale arată că performanța modelului WOA-SVM este semnificativ mai bună decât cea a modelului tradițional. model de recunoaștere a cancerului de sân, cu o acuratețe de 97,5%.
Pentru a rezolva problema supraadaptarii tehnicilor de învățare automată în clasificarea cancerului de sân, Singh și colab. [19] a propus o rețea neuronală artificială conectată funcțional (FLANN) și a descoperit experimental că modelul are o precizie ridicată pentru diagnosticarea precoce a cancerului de sân. Mahesh et al. [20] propun o tehnică de ansamblu XGBoost de predicție a cancerului de sân bazată pe modele de caracteristici cunoscute, mai întâi folosind tehnologia de supraeșantionare a minorității sintetice (SMOTE) pentru a face față problemelor de dezechilibru de date și zgomot și apoi folosind clasificatorul Bayes, clasificatorul arborelui de decizie și, respectiv, pădurea aleatoare. , combinat cu XGBoost și clasificarea datelor. Conform analizei experimentale, clasificatorul ansamblului XGBoost-Random Forest are o rată de precizie de 98,20% în depistarea precoce a cancerului de sân.
Pe baza XGBoost, pădure aleatoare, regresie logistică, vecinul K-cel mai apropiat și alte metode de învățare automată, această lucrare stabilește diferite modele pentru a clasifica și prezice cancerul de sân, care oferă o referință pentru diagnosticarea precoce a cancerului de sân. Atunci când majoritatea studiilor aplică modele de învățare automată pentru diagnosticarea celulelor canceroase de sân, ele se concentrează pe utilizarea preciziei, acurateței și scorului F1-al modelului ca indicatori pentru a evalua calitatea modelului, ignorând în același timp semnificația diagnosticului medical a rechemarea modelului, care indică proporția de celule maligne de cancer de sân care sunt prezise, și cu cât este mai mare reamintirea, cu atât este mai mare probabilitatea ca celulele maligne să fie prezise în celulele cancerului de sân. Prin urmare, acest articol ia reamintirea ca indice principal și ia în considerare precizia, acuratețea și scorul F1-pentru a evalua modelul utilizat.
În procesul de modelare, preprocesarea datelor este o parte foarte importantă, iar efectul modelului predictiv este diferit în funcție de metoda de procesare. Pentru a elimina influența diferitelor concepte dimensionale asupra efectului modelului, datele sunt standardizate. Pentru a găsi subsetul optim și a îmbunătăți acuratețea modelului, selecția caracteristicilor a fost făcută în funcție de coeficientul de corelație Pearson între variabila caracteristică și variabila țintă. Pentru problema dezechilibrului eșantionului pozitiv și negativ, se folosește metoda de eșantionare ierarhică pentru extragerea setului de antrenament și a setului de testare proporțional în funcție de diferite categorii. Având în vedere că efectul de predicție al modelelor de învățare automată variază în funcție de diferite diviziuni ale setului de date, această lucrare va folosi diferite diviziuni ale setului de date (8: 2 și 7: 3) ca două seturi de experimente pentru a observa efectul de predicție al modelului stabilit în această lucrare.
2. Preprocesarea datelor
2.1. Introducere date. Setul de date folosit în această lucrare este datele despre cancerul de sân din setul de date UCI, care a fost furnizat de celebrul Dr. William de la Institutul de Cercetare în Medicină Clinică al Universității din Wisconsin [21]. Caracteristicile sunt calculate dintr-o imagine digitalizată a unui aspirat cu ac fin (FNA) a unei mase mamare. Ele descriu caracteristicile nucleelor celulare prezente în imagine. Setul de date conținea 569 de probe experimentale, inclusiv 357 de probe benigne și 212 de probe maligne de cancer de sân. Pentru celulele extrase din fiecare obiect experimental, sunt colectate în principal următoarele zece caracteristici ale nucleului său: raza (media distanței de la centru la punctele perimetrului), perimetrul, netezimea (variația locală a lungimii razei), suprafața, compactitatea ( perimetru ∗ ∗ 2/zonă-1.0), concavitate (severitatea porțiunilor concave ale conturului), simetrie, textură (abaterea standard a valorilor scarii de gri), puncte concave (numărul de porțiuni concave) a conturului) și dimensiunea_fractală ("aproximarea coastei"-1). Media, eroarea standard și „cea mai proastă” sau cea mai mare (media celor trei valori mai mari) ale acestor caracteristici au fost calculate pentru fiecare imagine, rezultând 30 de caracteristici. Eticheta de clasificare reprezintă tipul de cancer de sân. Prin urmare, setul de date eșantion conține un total de 30 de caracteristici și o caracteristică de etichetă a eșantionului (malign și benign).
2.2. Standardizarea datelor.
Prin observarea intervalului de valori al fiecărei caracteristici, se constată că valorile datelor diferitelor caracteristici diferă foarte mult. În unele modele, dimensiunile diferite au o mare influență asupra efectului de predicție. De exemplu, algoritmul k-cel mai apropiat vecin bazat pe diviziunea distanței trebuie să mențină coerentă dimensiunea datelor, astfel încât datele trebuie să fie standardizate înainte de modelare. Cu toate acestea, unele modele sunt mai puțin afectate de dimensionalitate, cum ar fi algoritmul forestier aleatoriu. Pentru a face experimentul comparativ, datele diferitelor modele sunt tratate în același mod.
Pentru probleme cu diferite dimensiuni ale datelor eșantionului, metodele de procesare fără dimensiuni utilizate în mod obișnuit includ standardizarea datelor, iar metodele de standardizare a datelor includ standardizarea Min-max și standardizarea scorului Z. Dintre acestea, atunci când datele utilizate au valori aberante în afara intervalului de valori, sau valorile maxime și minime ale unor indicatori sunt necunoscute, se poate folosi standardizarea scorului Z.

În această lucrare, în conformitate cu caracteristicile setului de date WDBC privind cancerul de sân, a fost selectată standardizarea scorului Z pentru a procesa datele. Datele procesate de standardizarea scorului Z [22] urmează o distribuție normală standard, adică media este 0 și varianța este 1. Formula pentru standardizarea scorului Z este următoarea:

2.3. Selectarea caracteristicilor. Ca parte importantă a procesului de preprocesare a datelor, selecția caracteristicilor este de a găsi subsetul optim, Selectarea caracteristicilor poate reduce caracteristicile redundante și inutile pentru a îmbunătăți acuratețea modelului. Metoda de selecție a caracteristicilor este, în general, împărțită în metoda supragândirii, metoda încapsulării și metoda încorporarii. Metoda de filtrare poate fi independentă de algoritmul utilizat mai târziu în studiu și are o eficiență de calcul ridicată și o capacitate puternică de generalizare [23], astfel încât metoda de selecție a caracteristicilor din această lucrare utilizează metoda filtrului, iar rezumatul metodei generale în metoda de filtrare este prezentate în tabelul 2.
Datele despre cancerul de sân după normalizarea medie 0 îndeplinesc cerințele testului coeficientului de corelație Pearson în metoda de filtrare; deci, în această lucrare, coeficientul de corelație al lui Pearson [24] este utilizat pentru a testa corelația dintre fiecare caracteristică și variabila țintă. Formula coeficientului de corelație a lui Pearson este următoarea:

3. Construcție model
În această lucrare, categoriile de cancer de sân sunt prezise pe baza XGBoost, pădure aleatoare, regresie logistică și, respectiv, modelul K-nearest Neighbor. Cancerul de sân malign este considerat un eșantion pozitiv, în timp ce cancerul de sân benign este considerat un eșantion negativ
Pentru a rezolva problema dezechilibrului eșantionului, această lucrare folosește o metodă de eșantionare stratificată [25] pentru a extrage setul de antrenament și setul de testare proporțional cu toate tipurile de date din eșantion. Eșantionarea stratificată se mai numește și eșantionare de tip. Populația eșantion este împărțită în subpopulații care sunt independente unele de altele. Eșantionarea aleatorie a fost efectuată proporțional cu fiecare subpopulație. Eșantionarea stratificată atrage un eșantion mai reprezentativ și este mai potrivită pentru eșantioanele neechilibrate.
Partiționarea setului de date diferit poate duce la efecte diferite ale modelului. Prin urmare, această lucrare realizează două grupuri de experimente în funcție de o diviziune diferită a setului de date eșantion. Primul grup a împărțit setul de date într-un set de antrenament și set de testare într-un raport de 8: 2, iar al doilea grup a împărțit setul de date într-un set de antrenament și set de testare într-un raport de 7: 3. Observați performanța modelului de cei patru algoritmi sub partiţionarea setului de date diferit.
3.1. Indicatori de evaluare. În acest studiu, acuratețea, precizia, reamintirea și scorul F1-[26, 27] au fost utilizate pentru a evalua efectul de predicție al modelului. Având în vedere particularitatea diagnosticului medical, este de așteptat ca toate cancerele de sân maligne să poată fi prezise. Prin urmare, amintirea este considerată aici un indice de evaluare important. Cu cât reamintirea este mai mare, cu atât este mai mare proporția de cancer de sân malign care poate fi prezis. Rezultatele clasificării modelului pot genera o matrice de confuzie [28], așa cum se arată în Tabelul 4
Aici, TP este un adevărat pozitiv, indicând numărul de probe pozitive prezis ca probe pozitive. TN este un negativ adevărat, indicând numărul de eșantioane negative prezis ca probe negative. FP este un fals pozitiv, indicând numărul de probe pozitive prezis din probele negative, care se numește eroare de tip 1. FN este un fals negativ, indicând numărul de probe pozitive prezis ca probe negative, care se numește eroare de tip 2
Precizie, abreviată ca P. Pentru rezultatele prezise, precizia reprezintă câte dintre eșantioanele prezise pozitive sunt probe pozitive, iar formula este:


3.2. Model de predicție a cancerului de sân bazat pe XGBoost. XGBoost, prescurtare pentru creșterea gradului extrem, este un algoritm de Boosting [29]. Atât XGBoost, cât și random forest sunt algoritmi de integrare bazați pe arborele de decizie. Diferit de algoritmul Bagging, algoritmul Boosting construiește cursanți slabi unul câte unul, acumulând mai mulți cursanți slabi prin iterație continuă [30]. Funcția obiectiv este

. (9) Adăugarea de termeni obișnuiți poate reduce varianța modelului și poate face modelul obținut prin setul de antrenament mai simplu, pentru a preveni apariția overting-ului.. Algoritmul XGBoost este utilizat pentru a antrena modelul pe setul de date de antrenament. În procesul de antrenament al modelului, parametrii sunt ajustați pentru a obține un set mai bun de parametri și, în final, se obține modelul optim de predicție. Modelul a fost folosit pentru a prezice categoriile de cancer de sân în
setare. Când setul de date a fost împărțit într-un set de antrenament și un set de test cu 8: 2, acuratețea, precizia, retragerea și scorul F1- al modelului XGBoost au fost 0.974, {{5} },960, 1,00 și, respectiv, 0,980. Când modelul XGBoost a fost împărțit într-un set de antrenament și un set de testare cu 7: 3, acuratețea, precizia, retragerea și scorul F1-al modelului XGBoost erau 0.959, {{20} },946, 0,991 și, respectiv, 0,968. Rezultatele arată că modelul XGBoost are performanțe de predicție mai bune atunci când setul de date este împărțit la 8: 2. Rata de reamintire de 1 indică faptul că modelul XGBoost a prezis corect toate cancerele de sân maligne din eșantion, ceea ce este foarte important pentru diagnosticul medical.
osis. 3.3. Model de predicție a cancerului de sân pe baza pădurii aleatorii. Pădurea aleatorie este un algoritm de învățare supravegheată care integrează mai mulți arbori prin ideea Bagging [31–33]. Metoda bootstrap este utilizată pentru a extrage setul de eșantion de antrenament din datele eșantionului original, iar modelul de arbore de decizie corespunzător este antrenat pentru fiecare set de antrenament. În cele din urmă, toți clasificatorii de bază sunt votați, iar cel cu cele mai multe voturi este categoria finală.

sângeros. Când setul de date a fost împărțit într-un set de antrenament și un set de teste cu 8: 2, acuratețea, precizia, retragerea și scorul F1- al modelului de pădure aleatoare au fost 0.965, {{5 }}.947, 1.00 și, respectiv, 0.973. Când setul de date a fost împărțit într-un set de antrenament și un set de teste cu 7: 3, acuratețea, precizia, reamintirea și scorul F1- au fost 0,953, 0,946, { {18}}.981 și, respectiv, 0.963. Rezultatele arată că modelul forestier aleatoriu are o performanță de predicție mai bună atunci când setul de date este împărțit la 8: 2. Rata de reamintire a acestui model a fost, de asemenea, 1, indicând că modelul forestier aleatoriu a prezis corect și toți sânii maligni.

dar eu. Cele trei elemente de bază ale algoritmului k-cel mai apropiat vecin sunt măsurarea distanței, selecția valorii k, clasificarea decis. Cele trei elemente de bază ale algoritmului k-cel mai apropiat vecin sunt măsurarea distanței, selecția valorii k și regula de decizie de clasificare.
Pentru problema selecției valorii K în algoritmul k vecin cel mai apropiat, această lucrare utilizează metoda de validare încrucișată de zece ori (38, 39) și ia rata de reamintire ca indice de evaluare a modelului pentru a selecta o valoare k adecvată. Fie intervalul de valori al lui k 1–40, iar pentru fiecare k se efectuează validarea încrucișată de zece ori. Valoarea k cu rata maximă de retragere este valoarea k optimă. Rechemarea diferitelor valori k sub validarea încrucișată de zece ori este prezentată în Figura 1.
Din figura 1 se poate observa că pe măsură ce valoarea k crește, rechemarea scade. Când k � 3 și k � 5, amintirea este cea mai mare. Deoarece valoarea k este setată prea mică, este ușor de supraadaptat, astfel încât valoarea k este setată la 5 aici.
Când setul de date a fost împărțit într-un set de antrenament și un set de testare cu 8: 2, acuratețea, precizia, retragerea și scorul F1- al modelului k-nearest Neighbor au fost 0.912, { {6}}.888, 0.986 și, respectiv, {{10}}.934. Când setul de date a fost împărțit într-un set de antrenament și un set de teste cu 7: 3, acuratețea, precizia, retragerea și scorul F1-au fost 0,930, {{21} },906, 0,991 și, respectiv, 0,946. Rezultatele arată că modelul k-cel mai apropiat vecin are o performanță de predicție mai bună atunci când setul de date este împărțit la 7 : 3.
4. Comparație și analiză
Pentru a înțelege mai bine performanța modelului stabilit în această lucrare, această lucrare se bazează pe mediul de dezvoltare Python 3.9.7 și utilizează pentru experimente datele despre cancerul de sân furnizate de Dr. William de la Institutul de Cercetare Medicală Clinică de la Universitatea din Wisconsin.
Mediul experimental este sistemul de operare Windows 11, procesorul este Intel(R) Core(TM) i5-1155G7@ 2,50 GHz 2,50 GHz, iar memoria este de 8.00 GB.
Parametrii experimentali ai fiecărui model sunt prezentați în Tabelul 5, iar următoarele trei rezultate ale analizei comparative vor fi efectuate: (1) compararea performanței fiecărui model din această lucrare atunci când setul de date este împărțit într-un set de antrenament și un set de teste în 8 : 2. (2) Compararea performanței fiecărui model din această lucrare atunci când setul de date este împărțit într-un set de antrenament și un set de teste în 7 : 3. (3) Comparație cu unele modele din literatură [11–14].
(1) Când setul de date este împărțit într-un set de antrenament și un set de testare cu 8: 2, performanța fiecărui model este prezentată în Tabelul 6.
După cum se poate vedea din Tabelul 4, atunci când se împarte setul de antrenament și setul de testare într-un raport de 8: 2, acuratețea celor patru metode de învățare automată este peste 0.9, printre care XGBoost și RF sunt peste { {5}}.95. Precizia predicției XGBoost este 0.974, ceea ce indică o precizie ridicată a predicției. Pentru precizie, precizia modelului KNN nu este mare, sub 0.9, doar 0.888. XGBoost are cea mai mare precizie, care este 0,960. În ceea ce privește rechemarea, rechemarea XGBoost, a pădurii aleatoare și a algoritmilor de regresie logistică sunt toți 1. Algoritmul k-cel mai apropiat vecin are cea mai mică reamintire, dar este și peste 0.95. Pentru acest studiu, ratele de reamintire reprezintă proporția de mostre de cancer mamar malign care au fost diagnosticate corect. În medicină, o boală trebuie diagnosticată. Consecința de a nu fi diagnosticat este tratamentul întârziat, ceea ce poate duce la ratarea timpului optim pentru tratament. Acest lucru este mult mai grav decât a fi diagnosticat cu o boală fără a avea una. Prin urmare, rata de reamintire este un indicator foarte important în domeniul diagnosticului bolii. Aici, rechemarea XGBoost, pădure aleatoare și algoritm de regresie logistică sunt toate 1, indicând faptul că toate cancerele de sân maligne din probe au fost diagnosticate. Pentru scorul F{{20}}, se poate observa că scorul F1- al XGBoost, pădure aleatoare și regresie logistică sunt toate peste 0,95. Scorul F1-al algoritmului XGBoost este cel mai mare, ajungând la 0,980. Modelul K-cel mai apropiat vecin are cel mai mic scor F1-de 0,934. Luând în considerare cei patru indicatori, se poate spune că atunci când setul de date este împărțit într-un set de antrenament și un set de testare cu 8: 2, efectul general de model al algoritmului XGBoost este mai bun decât celelalte trei modele. XGBoost nu numai că a obținut o reamintire de 1, dar a obținut și o reamintire de 0,95 sau mai mult pentru celelalte trei valori.
(2) Când setul de date este împărțit într-un set de antrenament și un set de testare în 7: 3, performanța fiecărui model este prezentată în Tabelul 7.
După cum se poate observa din Tabelul 7, când setul de antrenament și setul de testare sunt împărțite la 7: 3, efectul de model al XGBoost și RF nu este la fel de bun ca cel al 8: 2. În primul rând, în ceea ce privește indicele important reamintire, la împărțirea setului de date la 8: 2, rechemarea XGBoost și RF au fost ambele 1, dar acum au scăzut la 0.991 și, respectiv, {{10}}.981 . Cele două modele au scăzut ușor și în ceilalți trei indici. Cu toate acestea, modificarea efectului de predicție al regresiei logistice și al modelului K-cel mai apropiat vecin este diferită de acești doi algoritmi. Pentru modelul de regresie logistică, cei patru indicatori abia s-au schimbat când setul de antrenament și setul de testare au fost împărțite la 7: 3 și, respectiv, 8: 2. Acest lucru arată că modelul de regresie logistică nu este aproape afectat de diferite partiții ale setului de date. În cazul unei împărțiri 7 : 3 între setul de antrenament și setul de testare, regresia logistică a arătat o acuratețe, precizie și un scor F1- mai scăzut decât XGBoost și pădure aleatoare. Cu toate acestea, rechemarea modelului de regresie logistică este 1, ceea ce indică faptul că toate cancerele de sân maligne au fost prezise, ceea ce este de mare importanță pentru diagnosticul bolii. Prin urmare, se poate spune că efectul de predicție al modelului de regresie logistică este mai bun decât al celorlalți trei algoritmi. Pentru modelul KNN, când setul de antrenament și setul de testare au fost împărțite la 7: 3, toți cei patru indici au crescut. Rechemarea a crescut la 0.991, care a fost mai mare decât cea a pădurii aleatorii. Precizia, precizia și scorul F1-au crescut de la 0,912, {{30}},887 și 0,934 la 0 .930, 0,906 și, respectiv, 0,946. Prin urmare, modelul KNN are performanțe mai bune în cazul setului de antrenament și al setului de testare împărțit la 7: 3 decât modelul împărțit la 8: 2. Analiza arată că împărțirea seturilor de date nu este fixă. Pentru diferite modele, diferite diviziuni aduc modificări diferite în efectul de predicție a modelului.
(3) Conform analizei comparative din Tabelele 6 și 7, modelul XGBoost stabilit în această lucrare (împărțirea setului de antrenament și a setului de test la 8: 2) are cel mai bun efect, iar următoarele îl compară cu performanța modelului în literatura [11–14] și rezultatele specifice sunt prezentate în Tabelul 8.
După cum se poate observa din Tabelul 8, modelele cele mai performante ale celor cinci modele sunt modelul de regresie logistică din literatură [13] și modelul XGBoost stabilit în această lucrare. Rechemarea și acuratețea modelului din literatura de specialitate [13] sunt 0.99 și respectiv 0.98, iar reamintirea și acuratețea modelului din această lucrare sunt 1.{{8} } și respectiv 0.974, în comparație cu literatura de specialitate [13], reamintirea modelului este mare, iar reamintirea în diagnosticul medical indică probabilitatea detectării celulelor canceroase, ceea ce este de mare importanță pentru clasificare a celulelor canceroase de sân, astfel încât modelul XGBoost stabilit în această lucrare are un efect de predicție mai bun și poate fi folosit ca instrument medical pentru a ajuta medicii să facă planuri de tratament pentru pacienții cu cancer de sân.

5. Concluzie
Această lucrare a prezis în principal categoriile de cancer de sân, de la preprocesarea datelor până la selecția caracteristicilor și apoi până la stabilirea modelului. În cele din urmă, rezultatele predicției au fost comparate și analizate din mai multe aspecte.
În această lucrare, amintirea este considerată un indice important pentru a prezice probele de cancer mamar malign cât mai precis posibil. Setul de date inițial conținea 30 de caracteristici, iar 15 caracteristici au fost selectate ca intrare a modelului prin testul de corelație Pearson. Înainte de construirea modelului, datele au fost standardizate pentru a elimina impactul diferitelor dimensiuni asupra efectelor modelului. Pentru problema probelor dezechilibrate pozitive și negative, metoda eșantionării stratificate este utilizată pentru extragerea seturilor de antrenament și seturi de testare proporțional în funcție de diferite categorii de date. Atunci când se selectează valoarea k optimă în vecinul k-cel mai apropiat, rechemarea este utilizată ca indice de evaluare a modelului, astfel încât valoarea k cu cea mai mare rată de retragere este valoarea optimă.
Modelele sunt comparate și analizate din trei aspecte. Rezultatele sunt prezentate după cum urmează:
pectelor. Rezultatele sunt prezentate după cum urmează: (1) În cazul împărțirii setului de antrenament și a setului de test la 8: 2, retragerea XGBoost, pădure aleatoare și regresie logistică este 1, ceea ce poate prezice toate cancerele de sân maligne K. -Rechemarea celui mai apropiat vecin este puțin mai mică decât 0.986 în comparație cu celelalte trei modele. Pentru acuratețea predicției, precizia și scorul F1- al modelului, rezultatele modelului XGBoost sunt mai bune decât rezultatele ale pădurii aleatoare și ale regresiei logistice, care sunt 0.974, {{1 0}},96 și, respectiv, 0,98, astfel încât modelul XGboost este selectat ca model de predicție final în condiția împărțirii 8:2 a setului de antrenament și a setului de testare.
(2) În cazul împărțirii setului de antrenament și setului de testare la 7 : 3, valorile celor patru indicatori de evaluare pentru XGBoost și pădure aleatoare au scăzut, în timp ce valorile celor patru indicatori de evaluare pentru modelul K-cel mai apropiat vecin au fost s-a îmbunătățit, dar pentru rechemare, doar reamintirea modelului de regresie logistică a fost 1, iar celelalte modele au fost peste 0.98, deci efectul de predicție al modelului de regresie logistică a fost cel mai bun, iar acuratețea și precizia predicției și scorul F1- al regresiei logistice au fost 0,947, {{10}},922 și, respectiv, 0,96.

(3) Din experimente se poate observa că în diferite diviziuni, efectul de predicție al modelului are diferite modificări. Comparând modelele optime din cele două seturi de experimente diferite, se poate observa că acuratețea predicției, precizia și scorul F1- al modelului XGBoost (care împarte setul de antrenament și setul de test la 8:2) sunt mai mari decât cele ale modelului de regresie logistică (care împarte setul de antrenament și setul de testare la 7: 3) când rechemarea este 1, deci modelul XGBoost (care împarte setul de antrenament și setul de test la 8: 2) funcționează cel mai bun în modelul stabilit în această lucrare. În plus, în comparație cu modelele din literatură [11–14], modelul XGBoost stabilit în această lucrare are un efect mai bun și poate identifica cu precizie celulele canceroase de sân maligne. Cu toate acestea, această cercetare se limitează la seturi de date numerice și, în viitor, vom încerca să folosim algoritmi de învățare profundă pentru a aplica diferite tehnici de extracție a caracteristicilor datelor de imagine (cum ar fi imaginile cu raze X) pentru a obține rezultate de clasificare mai bune.
Disponibilitatea datelor
Datele care susțin concluziile acestui studiu sunt disponibile în mod deschis în Depozitul UCI Machine Learning la https://archive.ics.uci.edu/ml/datasets/Breast+Cancer+Wisconsin+ %28Diagnostic%29.
Conflicte de interes
Autorii declară că nu au conflicte de interese.
Mulțumiri
Această lucrare a fost susținută de Fundația Națională de Științe Naturale din China (grantul nr. 61502156), proiectul de predare și cercetare al Comitetului pentru educație din Hubei (grantul nr. 282) și Fundația doctorală a Universității de Tehnologie din Hubei (grantul nr. BSQD13051).
Referințe
[1] V. Fotedar, S. Fotedar, P. Takur, S. Vats, A. Negi și L. Chanderkant, „Cunoașterea factorilor de risc pentru cancerul de sân și a metodelor de detectare precoce a acestuia în rândul lucrătorilor din domeniul sănătății primare din Shimla, Himachal. Pradesh”, Jurnalul de Educație și Promovarea Sănătății, vol. 8, p. 265, 2019.
[2] MS Simon, TA Hastert, A. Barac, et al., „Factori de risc cardiometabolici și supraviețuirea după cancer în inițiativa pentru sănătatea femeilor”, Cancer, voi. 127, nr. 4, p. 598–608, 2021.
[3] HF Pasha, RH Mohamed, MM Toam și AM Yehia, „Modificări genetice și epigenetice ale genei adiponectinei: p”, The Journal of Gene Medicine, voi. 21, nr. 10, p. e3120, 2019.
[4] D. Hong, AJ Fritz, SK Zaidi, et al., „Tranziția epitelială la mezenchimală și celulele stem canceroase contribuie la heterogenitatea cancerului de sân”, Journal of Cellular Physiology, voi. 233, nr. 12, p. 9136–9144, 2018.
[5] J. Zhong, D. Sun, W. Wei, și colab., „Aspirația cu ac fin ghidată cu ultrasunete cu contrast pentru biopsia ganglionului santinel în cancerul de sân în stadiu incipient”, Ultrasound in Medicine and Biology, vol. . 44, nr. 7, p. 1371–1378, 2018.
[6] K. Babic, C. Siguan-Bell, M. Hee și SC Lin, „Ocular g: ultrasound B-scan assessment of retained surgical sponge after Ahmed valve surgery: a case r,” Journal of Glaucoma, voi. 26, nr. 10, p. e239–e241, 2017.
[7] A. Yala, PG Mikhael, F. Strand, et al., „Către modele robuste bazate pe mamografie pentru riscul de cancer de sân”, Science Translational Medicine, voi. 13, nr. 578, ID articol eaba4373, 2021.
[8] G. Zheng, X. Liu și G. Han, „Revizuirea sistemului de diagnosticare și detecție asistată de computer pentru imagini medicale”, Journal of Software, vol. 29, nr. 5, p. 1471–1514, 2018.
[9] EY Huang, S. Knight, CR Guetter, et al., „Telemedicine and telementoring in the surgical specialties: a narative review, The American Journal of Surgery, vol. 218, nr. 4, pp. 760–766, 2019.
[10] Q. Wu, BT Wang, HR Rao, Y. Jiang și C. Liu, „Cancerul de sân și celulele bolii benigne formează cercetarea metrologică”, Journal of Anhui Medical University, voi. 31, nr. 02, p. 91–93, 1996.
[11] Q. Shen, F. Shao și R. Sun, „Modelul de predicție al cancerului de sân bazat pe xgboost”, Journal of Qingdao University (Natural Science Edition), voi. 32, nr. 1, 2019.
[12] Z. Deng, B. Su și K. Zhan. g, „Clasificarea cancerului de sân pe baza învățării ansamblului”, China Medical Devices, voi. 35, nr. 12, 2020.
[13] M. Monirujjaman Khan, S. Islam, S. Sarkar, et al., „Analiza comparativă bazată pe învățarea automată pentru predicția cancerului de sân”, Journal of Healthcare Engineering, voi. 2022, ID articol 4365855, 15 pagini, 2022.
[14] A. Bhardwaj, H. Bhardwaj, A. Sakalle, Z. Uddin, M. Sakalle și W. Ibrahim, „Analiza algoritmului de învățare automată și bazată pe arbori pentru clasificarea cancerului de sân”, Computational Intelligence and Neuroscience, voi. 2022, ID articol 6715406, 6 pagini, 2022.
[15] H. Dong și L. Ma, „Modelul de predicție al cancerului de sân triplu negativ bazat pe învățarea automată”, Jurnalul Universității Yunnan, voi. 39, nr. 1, p. 111–115, 2017.
For more information:1950477648nn@gmail.com






