Forbedre forstyrrelsesbaserte forklaringer ved å forstå rollen til usikkerhetskalibrering
Publisert i: 39. konferanse om nevrale informasjonsbehandlingssystemer (NeurIPS 2025)
Thomas Decker¹²³, Volker Tresp²³, Florian Büttner5
(¹ Siemens, ² LMU München, ³ München senter for maskinlæring (MCML), ⁴ Goethe University Frankfurt, ⁄Tysk kreftforskningssenter, tysk kreftkonsortium)
Forstyrrelsesbaserte forklaringer forbedrer ML-gjennomsiktigheten, men ukjent modellatferd under forstyrrelser kompromitterer påliteligheten deres. Vi beviser at modeller produserer upålitelige sannsynlighetsestimater under disse forstyrrelsene, noe som direkte forringer lokal og global forklaringskvalitet. Vi foreslår RecalX å kalibrere modeller for bedre forklaringer uten å endre originale spådommer, og forbedre robustheten.
Se på utgiverens side
Inkrementell usikkerhetsbevisst ytelsesovervåking med aktiv merkingsintervensjon
Publisert i: Proceedings of the 28. internasjonale konferanse om kunstig intelligens og statistikk, PMLR 258:2188‑2196, 2025
Alexander Köbler, Thomas Decker, Ingo Thon, Volker Tresp, Florian Büttner
Vi studerer overvåking av ML-modeller under gradvise distribusjonsskift, som sakte forringer nøyaktigheten uoppdaget. Vi foreslår inkrementell usikkerhetsbevisst ytelsesovervåking (IUPM), en etikettfri metode som estimerer ytelsesendringer ved hjelp av optimal transport. IUPM kvantifiserer prediksjonsusikkerhet og bruker aktiv merking under et begrenset budsjett for å gjenopprette estimater, og overgår grunnlinjene i skiftscenarier.
Se på utgiverens side
Wiki-Tabner: Integrering av navngitt enhetsgjenkjenning i Wikipedia-tabeller
Publisert i: 2025 Internasjonal ACM SIGIR-konferanse om forskning og utvikling innen informasjonshenting
Aneta Koleva, Martin Ringsquandl, Ahmed Hatem, Thomas Runkler, Volker Tresp
Eksisterende standarder for tabelltolkning forenkler ofte data fra den virkelige verden. For å løse dette introduserer vi WIKI-Tabner, et utfordrende datasett med komplekse Wikipedia-tabeller med flere enheter per celle, kommentert ved hjelp av DBpedia-klasser. Designet for navngitt enhetsgjenkjenning (NER) i tabellen og enhetskobling, detaljerer vi funksjonene, merkingen og et LLM-evalueringsrammeverk, etterfulgt av kvalitativ analyse av modellytelse og datasettbegrensninger.
Se på utgiverens side
Lightning UQ Box: Usikkerhetskvantifisering for nevrale nettverk
Publisert i: Journal of Machine Learning Research 26 (2025)
Nils Lehmann, Nina Maria Gottschling, Jacob Gawlikowski, Adam J. Stewart, Stefan Depeweg, Eric Nalisnick
Til tross for dyp lærings suksess, forårsaker dens svarte boks-natur og manglende tillitsestimater skepsis innen kritiske felt som medisin. For å gjøre usikkerhetskvantifisering (UQ) mer tilgjengelig og gjenbrukbar, introduserer vi Lightning UQ Box, et PyTorch-basert bibliotek drevet av PyTorch Lightning. Den støtter klassifisering, regresjon og segmentering på tvers av forskjellige UQ-metoder, og gir utøvere skalerbare, bruksklare verktøy.
Se på utgiverens side
Finkornet usikkerhetsnedbrytning i store språkmodeller: En spektral tilnærming
Publisert i: Proceedings of the AAAI Conference on Artificial Intelligence (AAAI26)
Nassim Walha¹², Sebastian G. Gruber⇓, Thomas Decker, Yinchong Yang, Alireza Javanmardi, Eyke Hüllermeier, Florian Buettner¹²³⁴
(¹ Tysk kreftforskningssenter (DKFZ), ² Tysk kreftkonsortium (DKTK), ³ Frankfurt Cancer Institute, Tyskland, ⁴ Goethe University Frankfurt, Tyskland, ⇓ ESAT-PSI, KU Leuven, Belgia, Siemens AG, LMU München, München senter for maskinlæring (MCML), Tysk senter for kunstig intelligens (DFKI), Kaiserslautern, Tyskland)
Ettersom LLM-er integreres i forskjellige applikasjoner, er det avgjørende å oppnå pålitelige prediktive usikkerhetsmål. Å skille mellom aleatorisk datatvetydighet og epistemiske modellbegrensninger er viktig for å adressere hver kilde. Vi introduserer spektral usikkerhet, en tilnærming som bruker kvanteinformasjonsteoriens Von Neumann-entropi for å skille total usikkerhet strengt i aleatoriske og epistemiske komponenter. Ved å utnytte semantisk likhet, overgår den toppmoderne metoder på tvers av forskjellige modeller og benchmarks.
Se på utgiverens side