Forbedring af forstyrrelsesbaserede forklaringer ved at forstå usikkerhedskalibreringens rolle
Udgivet i: 39. konference om neurale informationsbehandlingssystemer (NeurIPS 2025)
Thomas Decker¹²³, Volker Tresp²³, Florian Büttner5
(¹ Siemens, ² LMU München, ³ München Center for Machine Learning (MCML), ⁴ Goethe University Frankfurt, ⁄Tysk kræftforskningscenter, Tysk kræftkonsortium)
Forstyrrelsesbaserede forklaringer forbedrer ML-gennemsigtigheden, men ukendt modeladfærd under forstyrrelser kompromitterer deres pålidelighed. Vi beviser, at modeller producerer upålidelige sandsynlighedsestimater under disse forstyrrelser, hvilket direkte forringer lokal og global forklaringskvalitet. Vi foreslår RecalX at omkalibrere modeller for bedre forklaringer uden at ændre originale forudsigelser, hvilket forbedrer robustheden.
Se på udgiverens side
Trinvis usikkerhedsbevidst ydeevneovervågning med aktiv mærkningsintervention
Udgivet i: Forhandlinger fra den 28. internationale konference om kunstig intelligens og statistik, PMLR 258:2188‑2196, 2025
Alexander Köbler, Thomas Decker, Ingo Thon, Volker Tresp, Florian Büttner
Vi studerer overvågning af ML-modeller under gradvise distributionsskift, som langsomt nedbryder nøjagtigheden uopdaget. Vi foreslår inkremental usikkerhedsbevidst ydelsesovervågning (IUPM), en etiketfri metode, der estimerer ydeevneændringer ved hjælp af optimal transport. IUPM kvantificerer forudsigelsesusikkerhed og bruger aktiv mærkning under et begrænset budget til at gendanne estimater, hvilket overgår basislinjerne i skiftscenarier.
Se på udgiverens side
Wiki-Tabner: Integrering af navngivne enhedsgenkendelser i Wikipedia-tabeller
Udgivet i: 2025 International ACM SIGIR konference om forskning og udvikling inden for informationssøgning
Aneta Koleva, Martin Ringsquandl, Ahmed Hatem, Thomas Runkler, Volker Tresp
Eksisterende tabelfortolkningsbenchmarks forenkler ofte data fra den virkelige verden. For at løse dette introducerer vi WIKI-Tabner, et udfordrende datasæt med komplekse Wikipedia-tabeller med flere enheder pr. celle, kommenteret ved hjælp af DBpedia-klasser. Designet til navngivet enhedsgenkendelse (NER) i tabellen og enhedssammenkædning, detaljerer vi dens funktioner, mærkning og en LLM-evalueringsramme efterfulgt af kvalitativ analyse af modelydelse og datasætbegrænsninger.
Se på udgiverens side
Lightning UQ Box: Usikkerhedskvantificering for neurale netværk
Udgivet i: Tidsskrift for maskinlæringsforskning 26 (2025)
Nils Lehmann, Nina Maria Gottschling, Jacob Gawlikowski, Adam J.Stewart, Stefan Depeweg, Eric Nalisnick
På trods af deep learning's succes forårsager dens sorte bokse-karakter og manglende tillidsestimater skepsis inden for kritiske områder som medicin. For at gøre usikkerhedskvantificering (UQ) mere tilgængelig og genanvendelig introducerer vi Lightning UQ Box, et PyTorch-baseret bibliotek drevet af PyTorch Lightning. Det understøtter klassificering, regression og segmentering på tværs af forskellige UQ-metoder, hvilket giver praktikere skalerbare, brugsklare værktøjer.
Se på udgiverens side
Finkornet usikkerhedsnedbrydning i store sprogmodeller: En spektral tilgang
Udgivet i: Forhandlinger fra AAAI-konferencen om kunstig intelligens (AAAI26)
Nassim Walha¹², Sebastian G. Gruber⇓, Thomas Decker, Yinchong Yang, Alireza Javanmardi, Eyke Hüllermeier, Florian Buettner¹²³⁴
(¹ Tysk kræftforskningscenter (DKFZ), ² Tysk kræftkonsortium (DKTK), ³ Frankfurt Cancer Institute, Tyskland, ⁴ Goethe University Frankfurt, Tyskland, ⁄ ESAT-PSI, KU Leuven, Belgien, Siemens AG, LMU München, München Center for Machine Learning (MCML), Tysk Center for Kunstig Intelligens (DFKI), Kaiserslautern, Tyskland)
Da LLM'er integreres i forskellige applikationer, er det afgørende at opnå pålidelige prædiktive usikkerhedsmål. At skelne mellem aleatorisk datatetydighed og epistemiske modelbegrænsninger er afgørende for at adressere hver kilde. Vi introducerer spektral usikkerhed, en tilgang, der bruger kvanteinformationsteoriens Von Neumann-entropi til strengt at adskille total usikkerhed i aleatoriske og epistemiske komponenter. Ved at udnytte semantisk lighed overgår den avancerede metoder på tværs af forskellige modeller og benchmarks.
Se på udgiverens side