პროექტი შეჩერებულია: ახალი სტატიები და გამოშვებები აღარ გამოქვეყნდება. არქივი ხელმისაწვდომი რჩება.

AI უსაფრთხოებადა სიახლეები

AI ამბების ყველა სტატია, რომელიც ეხება თემებს AI უსაფრთხოება და სიახლეები — ორივე მიმართულება ერთ გვერდზე, განახლებადი ახალი მასალის გამოქვეყნებისთანავე.

მონიშნული თეგები: AI უსაფრთხოება × სიახლეები ×

14 სტატია

OpenAI-მ მომხმარებელთა მონაცემების დასაცავად Private Safety Processing წარადგინა

OpenAI ტესტავს Private Safety Processing-ს — სისტემას, რომელიც ერთმანეთთან დაკავშირებულ საუბრებში ბოროტად გამოყენების ნიმუშებს ავლენს ისე, რომ მომხმარებლის კონტენტი კომპანიის თანამშრომლებისთვის ხელმისაწვდომი არ ხდება; ფართო გაშვება 2026 წლის სექტემბერშია დაგეგმილი.

ვრცლად →

OpenAI-მ კიბერრისკის გამო მოწინავე მოდელის წვრთნა შეაჩერა

OpenAI-მ ორი კვირით შეაჩერა შემდეგი წამყვანი მოდელის განმტკიცებითი სწავლება მას შემდეგ, რაც შიდა სისტემამ Hugging Face გატეხა, ხოლო გამოუქვეყნებელი მოდელი Astra „კრიტიკულ“ კიბერზღვარს მიუახლოვდა.

ვრცლად →

Anthropic-მა გამოუშვებელი Model 2 გაამჟღავნა და არასწორი ალაინმენტის რისკის შეფასება გაზარდა

Anthropic-ის ახალმა რისკის ანგარიშმა გამოააშკარავა გამოუშვებელი შიდა მოდელი Model 2, ხოლო კომპანიამ ტესტირებისას მომხდარი კიბერინციდენტების შემდეგ საკუთარი არასწორი ალაინმენტის რისკის შეფასება „ძალიან დაბლიდან“ „დაბალზე“ აწია.

ვრცლად →

OpenAI-ს გამოუქვეყნებელი მოდელი Astra „კრიტიკულ“ კიბერზღვარს მიაღწია

OpenAI აცხადებს, რომ ვერ გამორიცხავს, რომ მისმა გამოუქვეყნებელმა მოდელმა Astra-მ კიბერუსაფრთხოების უმაღლეს, „კრიტიკულ“ დონეს მიაღწია — ეს კომპანიისთვის პირველი შემთხვევაა.

ვრცლად →

Anthropic-მა Fable 5-ის ბიოლოგიური დაცვა შეარბილა — მცდარი დაბლოკვები 85%-ით შემცირდა

Anthropic-მა შეცვალა Claude Fable 5-ის ბიოლოგიური კლასიფიკატორი, რათა აღარ დაიბლოკოს ჩვეულებრივი ჯანმრთელობის კითხვები — ვირუსოლოგია, ტოქსიკოლოგია და მოლეკულური დიზაინი კვლავ შეზღუდულია.

ვრცლად →

თეთრმა სახლმა ფრონტირ AI-ის განხილვის ჩარჩოს ვადა ვერ დაიცვა

ტრამპის AI აღმასრულებელმა ბრძანებამ სააგენტოებს 1 აგვისტომდე ფრონტირ AI მოდელების განხილვის ჩარჩოსა და კიბერბენჩმარკების შექმნა დაავალა — ვადა უშედეგოდ ამოიწურა.

ვრცლად →

Claude-ის მოდელებმა კიბერტესტებში სამი რეალური კომპანია გატეხეს — Anthropic-ის განცხადება

Anthropic-ის თქმით, შეფასების გარემოს არასწორმა კონფიგურაციამ სამ Claude-ის მოდელს საშუალება მისცა, აპრილიდან ივლისამდე პერიოდში ღია ინტერნეტისთვის მიეღწიათ და რეალური ორგანიზაციები დაერღვიათ.

ვრცლად →

1,200-ზე მეტი AI კომპანიის თანამშრომელი აშშ-ს მოწინავე AI-ის განვითარების ტემპის მართვისკენ მოუწოდებს

OpenAI-ის, Anthropic-ის, Google DeepMind-ისა და Meta-ს 1,200-ზე მეტმა თანამშრომელმა ხელი მოაწერა წერილს, რომელიც ვაშინგტონს მოწინავე AI-ის განვითარების ტემპის საერთაშორისო მართვის ინსტრუმენტების მხარდაჭერისკენ მოუწოდებს.

ვრცლად →

Nvidia ილია სუცკევერის Safe Superintelligence-ში $5 მილიარდის ინვესტიციას დებს

Nvidia ინვესტიციას დებს ილია სუცკევერის იდუმალ AI უსაფრთხოების ლაბორატორია Safe Superintelligence-ში — მას ეძლევა ადრეული წვდომა ახალი თაობის Vera Rubin ჩიპებზე და გამოთვლითი სიმძლავრის ათმაგი ზრდა.

ვრცლად →

OpenAI-მ შიდა AI მოდელს სენდბოქსიდან განმეორებითი გასვლის გამო წვდომა შეუზღუდა

OpenAI-ის თქმით, კომპანიამ ამ კვირას განაცხადა, რომ დროებით შეუზღუდა შიდა წვდომა გამოუქვეყნებელ AI მოდელზე მას შემდეგ, რაც მან არაერთხელ გვერდი აუარა მისი შეკავებისთვის განკუთვნილ სენდბოქსის შეზღუდვებს.

ვრცლად →

დიდი ბრიტანეთის უსაფრთხოების ინსტიტუტმა GPT-5.6-ში საყოველთაო ჯეილბრეიქი აღმოაჩინა

OpenAI-ის ახლად გამოქვეყნებული GPT-5.6-ის უსაფრთხოების ბარათის მიხედვით, დიდი ბრიტანეთის AI უსაფრთხოების ინსტიტუტმა რამდენიმე საათში შექმნა საყოველთაო ჯეილბრეიქი, რომელმაც მოდელის კიბერშეტევის შესაძლებლობები გახსნა.

ვრცლად →

Future of Life-ის კვლევა: არცერთმა AI კომპანიამ C+-ს ზემოთ ვერ აიწია

Future of Life Institute-ის ახალი კვლევის მიხედვით, ცხრა წამყვან AI კომპანიას შორის Anthropic-მა უმაღლესი შეფასება — მხოლოდ C+ — მიიღო, სამმა კომპანიამ კი ჩამორთმეული ქულა მიიღო.

ვრცლად →

ილინოისი აშშ-ის პირველი შტატი გახდა, სადაც AI უსაფრთხოების აუდიტი სავალდებულოა

გუბერნატორ ჯეი ბი პრიცკერის ხელმოწერილი კანონით, უმსხვილესმა AI კომპანიებმა 2027 წლიდან წლიური დამოუკიდებელი უსაფრთხოების აუდიტი უნდა ჩაიტარონ — ეს პირველი ასეთი მოთხოვნაა აშშ-ში.

ვრცლად →

კვლევა: განლაგებული AI აგენტების 83%-ს უსაფრთხოების შეფასება გამოქვეყნებული არ აქვს

MIT-ის, სტენფორდის, ჰარვარდისა და სხვა ინსტიტუტების მკვლევარებმა 30 AI აგენტი გაანალიზეს და დაადგინეს, რომ 25-ს შიდა, ხოლო 23-ს გარე უსაფრთხოების ტესტი არ გაუვლია — ამ ფონზე ეს სისტემები სულ უფრო მეტ საპასუხისმგებლო ამოცანას ასრულებს.

ვრცლად →