По материалам сайта Nur.KZ, передает Qazaq24.com.
Опечатка из 1950-х годов "вегетативная электронная микроскопия" попала в публикации и закрепилась в языковых моделях ИИ, пишет Futura.
Научное сообщество столкнулось с необычной проблемой: бессмысленное выражение "вегетативная электронная микроскопия" (vegetative electron microscopy) закрепилось в академических публикациях и обучающих выборках искусственного интеллекта. Ошибка возникла еще в 1950-х годах при сканировании и распознавании текста двух статей из журнала "Bacteriological Reviews". Из-за сбоя слово "вегетативный" из одной колонки случайно соединилось со словом "электронный" из соседней секции, сформировав несуществующий термин.
Десятилетия спустя бессмыслица проявилась в иранских научных работах 2017 и 2019 годов. Причиной стала ошибка перевода: в фарси слова "вегетативный" и "сканирующий" отличаются лишь одним диакритическим знаком. По данным сервиса "Google Scholar", странное выражение встречается уже в 22 научных публикациях. Издательство "Springer Nature" отозвало подобные статьи, тогда как "Elsevier" сначала пыталось оправдать корректность термина, но позже выпустило исправления.
Ситуация усугубилась с развитием нейросетей. Исследователи выяснили, что алгоритмы "GPT-3", "GPT-4o" и "Claude 3.5" постоянно завершают предложенные фразы именно этим бессмысленным сочетанием, так как оно попало в гигантский архив веб-данных "CommonCrawl". Случай наглядно продемонстрировал уязвимость научных издательств и показал необходимость усиления контроля за качеством данных, на которых обучаются современные языковые модели.