ახალი კვლევის თანახმად, რომელიც Pew Research Center-მა ჩაატარა, ინგლისურენოვანი ვებგვერდების დაახლოებით მესამედს, რომლებიც ChatGPT-ის 2022 წლის ბოლოს გაშვების შემდეგ გამოქვეყნდა, სტატისტიკურად ნათლად ეტყობა ხელოვნური ინტელექტის მიერ დაწერის კვალი. ეს ერთ-ერთი ყველაზე მასშტაბური მცდელობაა, გაზომოს, რამდენად „მანქანურად დაწერილი“ გახდა ღია ინტერნეტი დღეისთვის.
რა აჩვენა კვლევამ
Pew-ის Data Labs-ის გუნდმა გაანალიზა თითქმის 500,000 ინგლისურენოვანი გვერდი Common Crawl-ის ვებარქივიდან — 2021 წლის იანვრიდან 2026 წლის ივლისამდე პერიოდის ჩათვლით. მკვლევრებმა გვერდები გაატარეს Pangram-ის ღია წონების AI-დეტექტორის მოდელში, რომელიც ავლენს დიდი ენობრივი მოდელებისთვის დამახასიათებელ წერის ნიმუშებს.
2026 წლის ივლისის სრულ ნიმუშში AI-ს დაწერის მნიშვნელოვანი ნიშნები აღმოაჩინეს გვერდების 10%-ში. მაგრამ როცა ნიმუში მხოლოდ ChatGPT-ის 2022 წლის ნოემბრის გაშვების შემდეგ გამოქვეყნებულ გვერდებით შემოიფარგლა, ეს წილი მესამედს გადააჭარბა.
AI-ს მიერ დაწერილად მონიშნული კონტენტი თანაბრად არ არის განაწილებული დომენებზე: მოხსენების მიხედვით, .com დომენის გვერდების დაახლოებით ათიდან ერთს ჰქონდა AI-ს ნიშნები, .org დომენზე ეს მაჩვენებელი 4.6%-ია, ხოლო .edu და .gov დომენებზე — თითოეულზე დაახლოებით 1%.
შეიცვალა წერის სტილიც
მკვლევრებმა ასევე თვალყური ადევნეს, როგორ შეიცვალა ვებწერის სტილი 2023-2026 წლებში — პერიოდში, რომელიც დაახლოებით ემთხვევა გენერაციული AI-ის მასობრივ გავრცელებას. ტირეს (em dash) გამოყენება თითქმის გაორმაგდა, ოქსფორდის მძიმის გამოყენება 63%-ით გაიზარდა, ხოლო ისეთი სიტყვები, რომლებიც ხშირად AI-გენერირებულ ტექსტს ახასიათებს — მაგალითად, ინგლისურში „delve“, „interplay“ და „testament“ — სიხშირით ორმაგზე მეტად გაიზარდა. კონსტრუქციები, როგორიცაა „ეს არა მხოლოდ X-ია, არამედ Y“, თითქმის გასამმაგდა.
Pew-ის მკვლევრები აფრთხილებენ, რომ ცალკეულ ნიშანს დიდი მნიშვნელობა არ უნდა მიენიჭოს: მხოლოდ ტირის ან ოქსფორდის მძიმის გამოყენება თავისთავად არაფერს ამბობს იმაზე, ვინ დაწერა გვერდი — დეტექტორის მოდელი ეყრდნობა სტატისტიკურ ნიმუშებს დიდი მოცულობის ტექსტში, და ეს ნიმუშებიც შეიძლება ცალკეულ გვერდებზე შემცდარი აღმოჩნდეს.
რატომ აქვს ამას მნიშვნელობა
კვლევის შედეგები ამდიდრებს მიმდინარე დისკუსიას იმის შესახებ, როგორ მუშაობს AI დეტექცია და რამდენად შეიძლება მისი ნდობა — თემა, რომელიც უფრო დეტალურად განვიხილეთ სტატიაში „როგორ მუშაობს AI ტექსტის დეტექტორები“. ისინი ასევე ეხება საძიებო სისტემებს, გამომცემლებსა და პლატფორმებს, რომლებიც ცდილობენ მასშტაბურად გამოარჩიონ ადამიანის მიერ დაწერილი კონტენტი მანქანურისგან, და ემატება მზარდ AI კვლევას, რომელიც აღწერს, რამდენად სწრაფად შეცვალა ინტერნეტის ყოველდღიური კონტენტი გენერაციულმა ხელსაწყოებმა — GPT მოდელების ოჯახსა და მის კონკურენტებზე დაფუძნებულმა.