W skrócie
- Sztuczna inteligencja skutecznie weryfikuje dane naukowe, wyłapując pomyłki w wieloletnich bazach chemicznych i pomagając naukowcom poprawiać błędne informacje w literaturze.
- Agenty AI powtarzają eksperymenty, ale badania wskazują na trudności w replikacji tez oraz rosnącą liczbę błędów obliczeniowych w publikacjach naukowych z ostatnich lat.
- Narzędzia oparte na sztucznej inteligencji wymagają nadzoru badaczy, ponieważ generują fałszywe alarmy i nie zawsze poprawnie oceniają złożone publikacje naukowe.
- Więcej podobnych informacji znajdziesz na stronie głównej serwisu, otwiera się w nowym oknie
Sztuczna inteligencja wyłapuje błędy w publikacjach naukowych
Rozwój dużych modeli językowych napędza wizję automatyzacji odkryć naukowych, w której cyfrowi asystenci naukowi (ang. AI Co-Scientists) pomagają stawiać hipotezy, pisać kod i tworzyć manuskrypty. Przyspieszenie prac - od generowania założeń po dowodzenie twierdzeń matematycznych - rodzi jednak wyzwania.
Tradycyjny proces recenzowania prac przez ludzi nie jest w stanie nadążyć za masowym napływem publikacji powstających przy wsparciu algorytmów. Rozwiązaniem tego narastającego problemu staje się wykorzystanie sztucznej inteligencji do automatyzacji i przyspieszenia samego procesu weryfikacji oraz oceny badań - w tym z dziedziny chemii.
Przez dziesięciolecia chemicy polegali na tablicowych wartościach temperatur wrzenia cząsteczek, używając ich do identyfikacji substancji i planowania procesów, takich jak destylacja. Model sztucznej inteligencji wykazał jednak, że część danych w zaufanej, 75-letniej bazie referencyjnej zawierała błędy.
Sebastian Pios z laboratorium Zhejiang w Hangzhou w Chinach zauważył rozbieżności podczas prognozowania parametrów cząsteczek. Po ręcznym zweryfikowaniu literatury okazało się, że to podręczniki zawierały pomyłki, w tym błędy drukarskie i przestarzałe dane pomiarowe sprzed wieku. Pios należy do rosnącej grupy badaczy wykorzystujących nowe technologie do audytu wiedzy naukowej i tropienia pomyłek w bazach danych oraz artykułach naukowych.
Agenty AI szybko weryfikują dane na dużą skalę
Analitycy z SAI Labs z Delaware (USA) użyli agentów AI do oceny 168 prac wybranych na konferencję ICML w 2026 r. Autonomiczne systemy wyekstrahowały twierdzenia autorów, pobrały materiały i powtórzyły eksperymenty. Z 92 artykułów, posiadających co najmniej 5 weryfikowalnych tez, algorytmy zdołały odtworzyć więcej niż 2 z nich jedynie w 34 przypadkach. Ponad 80 proc. twierdzeń powtórzono pomyślnie zaledwie w 8 pracach. Może to dowodzić, że tzw. kryzys replikacyjny, kojarzony z psychologią i naukami społecznymi, jest istotnym problemem także w naukach ścisłych.
Z kolei badanie Jamesa Zou ze Stanford University wykazało, że średnia liczba błędów w publikacjach z konferencji NeurIPS wzrosła z 3,8 w 2021 r. do 5,9 w 2025 r., co stanowi wzrost o 55 proc. Analiza skupiała się na obiektywnych pomyłkach w formułach, obliczeniach i wykresach, celowo pomijając kwestie interpretacji danych czy nowości naukowej. Paradoksalnie to może wynikać z faktu wykorzystania dużych modeli językowych (LLMs) w pisaniu artykułów naukowych i nieweryfikowania ich halucynacji przez ludzi, którzy podpisują się jako ich autorzy.
"Największą różnicą jest możliwość robienia tego na skalę, jaka nie była wcześniej możliwa" - tłumaczy James Zou. "AI nie powinna robić wszystkiego i powinna pozostawiać wybory dotyczące nowości i znaczenia ludziom" - dodaje Federico Bianchi z Together AI.
Ograniczona niezawodność cyfrowych recenzentów
Mimo dużej szybkości cyfrowe narzędzia audytowe oparte na AI nie są bezbłędnymi arbitrami. Odd Erik Gundersen z Norweskiego Uniwersytetu Nauki i Technologii w Trondheim zauważa, że systemy te "popełniają błędy podobnie jak ludzie", dlatego wymagają nadzoru ze strony badaczy.
Narzędzia te bywają pomocne jako druga para oczu przed wysłaniem pracy do recenzji - w ankiecie przeprowadzonej wśród 733 naukowców zgłaszających prace na konferencję ICML w 2026 r. 35 proc. badanych przyznało, że automatyczne wsparcie wykryło błędy w ich publikacjach, a 31 proc. podjęło pod wpływem informacji zwrotnej nowe eksperymenty. Jednocześnie tegoroczne badanie wykazało, że najlepszy model wykrył najwyżej 1/5 błędów wskazanych wcześniej przez ludzkich recenzentów, generując przy tym fałszywe alarmy.
Naukowcy ostrzegają przed bezkrytycznym przyjmowaniem wyników generowanych przez algorytmy, bowiem mogą one przeoczyć założenia badawcze albo wymyślić nieistniejące problemy, co w przypadku bezpośredniego wpływu na decyzje o publikacji mogłoby doprowadzić do odrzucenia poprawnej pracy. Inicjatywy takie jak Black Spatula Project testują obecnie skuteczność modeli w starciu z pracami zawierającymi znane pomyłki, poddając wyniki ocenie ekspertów.
Zobacz również:
Źródło: Stokel-Walker Ch. AI agents are checking the scientific literature - and spotting decades-old errors. Nature (2026). DOI: 10.1038/d41586-026-02235-8













