När AI-koden kör fast: statistik handlar mer om ställda frågor än kod

Under det senaste året har en ny kategori av förfrågningar blivit allt vanligare i min inkorg. Det är forskare, analytiker och företagare som skickar över ett R-skript som uppvisar kryptiska felmeddelanden, ger orimliga resultat eller som de helt enkelt känner en växande osäkerhet inför. Gemensamt för nästan alla dessa fall är att koden från början skrivits av en AI-assistent.

Det råder ingen tvekan om att språkmodeller och AI-verktyg har förändrat hur vi kodar. Att snabbt få förslag på syntax, transformera om en datatabell eller felsöka ett ilsket kommatecken kan spara enormt mycket tid. Som ett komplement i vardagen är AI-assistenter fantastiska. Men när verktyget får ta över ratten helt utan att föraren kan vägens grundläggande regler uppstår snabbt problem.

För att skriva fungerande R-kod räcker det sällan med att bara be en chatbot generera ett skript. Du måste förstå den underliggande logiken för att kunna läsa koden, modifiera den och framför allt förstå varför den gör som den gör. När ett skript kraschar krävs det att du förstår datastrukturer, paketberoenden och funktionsargument för att leda AI:n rätt igen, snarare än att bara klistra in felmeddelandet i en evig loop. Denna grundläggande hantverksskicklighet är anledningen till att jag lägger så stor vikt vid fundamentet i mina kurser och i min bok Modern Statistics with R. Med en stabil grund blir AI-assistenten en kraftfull medhjälpare; utan den blir den en källa till subtila fel som kan ta dagar att upptäcka.

Men kodsyntaxen är i själva verket bara den första och lättaste tröskeln. Det djupare problemet uppstår när vi förväntar oss att AI-assistenten ska stå för den statistiska analysen.

En betydande del av mitt arbete som statistikkonsult handlar inte om att skriva kod överhuvudtaget. Det handlar om att ställa det som ibland kan verka som ”dumma frågor”. Hur samlades data in? Vad hände den där tisdagen då hälften av mätvärdena saknas? Är observationerna verkligen oberoende av varandra? Vilka undantag och märkligheter döljer sig bakom de städade kolumnnamnen?

AI-modeller saknar den domäninsikt och den kritiska skepticism som krävs för att genomskåda ett dataset. Tvärtom: de har förutfattat meningar utifrån gamla exempel de sett och lyckas inte upptäcka när data motsäger deras förväntningar. AI-modeller bygger på mönsterigenkänning från existerande text och kod, vilket ofta innebär att de rutinmässigt föreslår de mest välkända och standardiserade metoderna – oavsett om förutsättningarna för dem är uppfyllda eller inte.

När en kund kommer till mig med en idé om att köra en specifik standardanalys som AI:n rekommenderat, visar det sig mycket ofta efter en närmare granskning att vi måste välja en helt annan väg. Kanske har data en skev fördelning, en hierarkisk struktur eller mätfel som gör standardmodellen direkt missvisande. Att identifiera detta kräver statistisk intuition och erfarenhet – egenskaper som inte går att prompta fram.

AI kan hjälpa dig att skriva koden snabbare, men den kan inte ta ansvaret för att rätt modell används på rätt sätt för rätt fråga. Om du vill bygga en hållbar kompetens i R och statistik handlar det därför om att investera i förståelsen. När du behärskar grunderna blir AI:n precis vad den borde vara: en effektiv assistent, inte en osäker metodexpert.

Intervju om kurs

I november gav jag en kurs om machine learning och AI för forskare som tillhör EpiHealth – ett svenskt forskningsnätverk som ägnar sig åt epidemiologisk forskning för att bättre förstå utbredning och bakomliggande orsaker till olika sjukdomar.

På EpiHealths webbplats berättar en av deltagarna om kursen:

What was the most important lesson?
– That machine learning is more accessible than I thought! The course provided a broad introduction to different methods – everything from classic regression models to advanced neural networks. We also got to try applying them in practice, which will really help when I implement the methods on my own. In addition to new knowledge, I take with me the insight that these tools are fully possible to use even for researchers without a technical background and that they can open completely new doors for epidemiological research. The idea workshop was in full swing on the train home, and I am now looking forward to implementing what I learned in my own research.

Jag jobbar med den här sortens modeller varje dag, och det är minst sagt spännande att följa utvecklingen som sker just nu. Med moderna verktyg är maskininlärning och AI tillgängligare än någonsin. Den mest intressanta utvecklingen, den som faktiskt gör skillnad för beslutsfattande och forskning, har ingenting med ChatGPT att göra. Istället är det ofta helt andra modeller som används. Om det, och mycket annat, handlade den här kursen.

Statistisk analys av biomarkörsdata

Ett problem som jag återkommit till många gånger genom åren, både som forskare och som konsult, är statistisk analys av biomarkörsdata. Biomarkörer är mätvärden från exempelvis blodprov, som beskriver mängden av till exempel olika proteiner eller molekyler. De är en viktig del av modern medicin, och används flitigt inom medicinsk forskning, där man letar efter biomarkörer som går att använda för att diagnosticera sjukdomar, ge prognoser för risken att drabbas av en sjukdom, eller för att förstås mekanismerna bakom olika åkommor.

Biomarkörsdata kännetecknas av en rad utmaningar: många variabler men få observationer, data som inte är normalfördelade, mätvärden som ligger under mätteknikens detektionsgräns. Det här kräver specialiserade statistiska metoder. Om det handlar ena dagen i min nya tvådagarskurs om medicinsk statistik. Den andra dagen fokuserar på överlevnadsanalys.

Intresserad av att lära dig mer om moderna statistiska metoder inom medicin? Ta en titt på årets kursdatum eller kontakta mig för att boka en kurs på plats hos er.

Ny utgåva av Modern Statistics with R

Den andra utgåvan av min bok Modern Statistics with R har nu släppts. Den handlar om allt från grundläggande statistiska koncept till R-programmering, avancerade regressionsmodeller och machine learning. Boken går att läsa gratis på nätet eller köpa i fysisk form i bokhandlar (utgiven internationellt av CRC Press).

Förutom att Modern Statistics with R används som kurslitteratur på universitet världen över så ligger den också till grund för de R-kurser jag ger i samarbete med Statistikakademin. Intresserad av att lära dig mer om R, statistik, machine learning eller AI? Ta en titt på höstens och vårens kursdatum eller kontakta mig för att boka en kurs på plats hos er.

Att få bättre förståelse för AI

Utvecklingen inom AI går svindlande fort och allt fler organisationer försöker förstå hur de kan använda AI i sin verksamhet. Som någon som jobbat inom området i många år stöter jag en hel del missförstånd kring vad dagens AI egentligen kan göra och kring vad som ligger runt hörnet. Å ena sidan underskattar många hur långt AI har kommit och hur användbart det kan vara – många framsteg sker utan att vi märker dem. Å andra sidan överskattar många AI och missar att det som rapporteras i media bygger på pressmeddelanden från företag som gärna överdriver hur bra deras system egentligen är.

Av den här anledningen ger jag sedan 2019 en kurs om AI och machine learning riktad mot beslutsfattare, chefer, projektledare och forskare som planerar att vara inblandade i AI-projekt eller helt enkelt vill få en bättre förståelse för ämnet. Det enda förkunskapskravet är grundläggande datorvana. På kursen testar vi att bygga några AI-modeller samtidigt som vi diskuterar frågor som:

  • Hur fungerar AI och machine learning?
  • Hur vet man att ett AI-system fungerar som det ska?
  • Vad kan man egentligen göra med den här tekniken idag?
  • Vad krävs för att ett AI-projekt ska bli framgångsrikt?
  • Hur kommer utvecklingen att se ut de närmaste åren?

Jag ger dels på begäran kursen på plats hos företag och myndigheter, och dels online vid schemalagda tillfällen (härnäst den 26 oktober och den 18 april – boka din plats här).