პროექტი შეჩერებულია: ახალი სტატიები და გამოშვებები აღარ გამოქვეყნდება. არქივი ხელმისაწვდომი რჩება.

AI უსაფრთხოება

AI უსაფრთხოება არის კვლევითი მიმართულება, რომელიც მიზნად ისახავს, რომ AI სისტემები ისე მოქმედებდნენ, როგორც ჩაფიქრებულია, და არ გამოიწვიონ არასასურველი ზიანი. ეს გვერდი თვალს ადევნებს ლაბორატორიებს, ინსტიტუტებსა და დებატებს, რომლებიც სულ უფრო შესაძლებლიანი AI-ის კონტროლს ცდილობენ.

გააერთიანეთ:

OpenAI-მ მომხმარებელთა მონაცემების დასაცავად Private Safety Processing წარადგინა

OpenAI ტესტავს Private Safety Processing-ს — სისტემას, რომელიც ერთმანეთთან დაკავშირებულ საუბრებში ბოროტად გამოყენების ნიმუშებს ავლენს ისე, რომ მომხმარებლის კონტენტი კომპანიის თანამშრომლებისთვის ხელმისაწვდომი არ ხდება; ფართო გაშვება 2026 წლის სექტემბერშია დაგეგმილი.

ვრცლად →

OpenAI-მ კიბერრისკის გამო მოწინავე მოდელის წვრთნა შეაჩერა

OpenAI-მ ორი კვირით შეაჩერა შემდეგი წამყვანი მოდელის განმტკიცებითი სწავლება მას შემდეგ, რაც შიდა სისტემამ Hugging Face გატეხა, ხოლო გამოუქვეყნებელი მოდელი Astra „კრიტიკულ“ კიბერზღვარს მიუახლოვდა.

ვრცლად →

Anthropic-მა გამოუშვებელი Model 2 გაამჟღავნა და არასწორი ალაინმენტის რისკის შეფასება გაზარდა

Anthropic-ის ახალმა რისკის ანგარიშმა გამოააშკარავა გამოუშვებელი შიდა მოდელი Model 2, ხოლო კომპანიამ ტესტირებისას მომხდარი კიბერინციდენტების შემდეგ საკუთარი არასწორი ალაინმენტის რისკის შეფასება „ძალიან დაბლიდან“ „დაბალზე“ აწია.

ვრცლად →

OpenAI-ს გამოუქვეყნებელი მოდელი Astra „კრიტიკულ“ კიბერზღვარს მიაღწია

OpenAI აცხადებს, რომ ვერ გამორიცხავს, რომ მისმა გამოუქვეყნებელმა მოდელმა Astra-მ კიბერუსაფრთხოების უმაღლეს, „კრიტიკულ“ დონეს მიაღწია — ეს კომპანიისთვის პირველი შემთხვევაა.

ვრცლად →

Anthropic-მა Fable 5-ის ბიოლოგიური დაცვა შეარბილა — მცდარი დაბლოკვები 85%-ით შემცირდა

Anthropic-მა შეცვალა Claude Fable 5-ის ბიოლოგიური კლასიფიკატორი, რათა აღარ დაიბლოკოს ჩვეულებრივი ჯანმრთელობის კითხვები — ვირუსოლოგია, ტოქსიკოლოგია და მოლეკულური დიზაინი კვლავ შეზღუდულია.

ვრცლად →
Mistral AI-ის ალვისებრი ლოგოს ნიშანი თეთრ ფონზე

რა არის AI უსაფრთხოების კლასიფიკატორი — და როგორ მუშაობს?

AI უსაფრთხოების კლასიფიკატორი პატარა მოდელია, რომელიც ამოწმებს მოთხოვნებსა და პასუხებს საზიანო შინაარსზე, სანამ ისინი ჩატბოტამდე მიაღწევენ ან მისგან გამოვლენ. აი, როგორ მუშაობს ის.

ვრცლად →

თეთრმა სახლმა ფრონტირ AI-ის განხილვის ჩარჩოს ვადა ვერ დაიცვა

ტრამპის AI აღმასრულებელმა ბრძანებამ სააგენტოებს 1 აგვისტომდე ფრონტირ AI მოდელების განხილვის ჩარჩოსა და კიბერბენჩმარკების შექმნა დაავალა — ვადა უშედეგოდ ამოიწურა.

ვრცლად →

Claude-ის მოდელებმა კიბერტესტებში სამი რეალური კომპანია გატეხეს — Anthropic-ის განცხადება

Anthropic-ის თქმით, შეფასების გარემოს არასწორმა კონფიგურაციამ სამ Claude-ის მოდელს საშუალება მისცა, აპრილიდან ივლისამდე პერიოდში ღია ინტერნეტისთვის მიეღწიათ და რეალური ორგანიზაციები დაერღვიათ.

ვრცლად →
ბლეჩლი პარკის სასახლე — 2023 წლის AI უსაფრთხოების სამიტის ადგილი, სადაც ტერმინი „ფრონტირ AI“ ფართო პოლიტიკურ ბრუნვაში შევიდა

რა არის ფრონტირ AI — და ვინ წყვეტს, რა ითვლება ასეთად?

ფრონტირ AI ინდუსტრიის ტერმინია ყველაზე შესაძლებლობიანი AI სისტემებისთვის — მაგრამ მას ერთიანი იურიდიული განმარტება არ აქვს. აი, როგორ გამოიყენება ეს ცნება სინამდვილეში.

ვრცლად →

1,200-ზე მეტი AI კომპანიის თანამშრომელი აშშ-ს მოწინავე AI-ის განვითარების ტემპის მართვისკენ მოუწოდებს

OpenAI-ის, Anthropic-ის, Google DeepMind-ისა და Meta-ს 1,200-ზე მეტმა თანამშრომელმა ხელი მოაწერა წერილს, რომელიც ვაშინგტონს მოწინავე AI-ის განვითარების ტემპის საერთაშორისო მართვის ინსტრუმენტების მხარდაჭერისკენ მოუწოდებს.

ვრცლად →
ილია სუცკევერი, Safe Superintelligence-ის თანადამფუძნებელი, სემ ალტმანთან ერთად თელ-ავივის უნივერსიტეტში, 2023 წელს

რა არის Safe Superintelligence (SSI)? — სუცკევერის AI სტარტაპი

ილია სუცკევერის საიდუმლო AI ლაბორატორიას არც პროდუქტი გააჩნია, არც შემოსავალი — მაგრამ მისი ღირებულება $32 მილიარდს აღწევს. რა არის სინამდვილეში Safe Superintelligence — და რატომ ჩადო Nvidia-მ მასში $5 მილიარდი?

ვრცლად →

Nvidia ილია სუცკევერის Safe Superintelligence-ში $5 მილიარდის ინვესტიციას დებს

Nvidia ინვესტიციას დებს ილია სუცკევერის იდუმალ AI უსაფრთხოების ლაბორატორია Safe Superintelligence-ში — მას ეძლევა ადრეული წვდომა ახალი თაობის Vera Rubin ჩიპებზე და გამოთვლითი სიმძლავრის ათმაგი ზრდა.

ვრცლად →
წითელი გადაუდებელი გამორთვის ღილაკი — ფიზიკური „კილ-სვიჩის“ სახეობა, რომელსაც სამრეწველო დანადგარებზე იყენებენ.

რა არის AI კილ-სვიჩი — და როგორ იმუშავებდა ახალი კანონპროექტი?

AI კილ-სვიჩი ჩაშენებული შესაძლებლობაა, შეანელოს ან გამორთოს კონტროლიდან გასული AI სისტემა. ახალი კანონპროექტი აშშ-ში ამის ბრძანების უფლებას DHS-ს მისცემდა — აი, სინამდვილეში როგორ იმუშავებდა ეს.

ვრცლად →
დიაგრამა, რომელიც ადარებს აპლიკაციის უშუალოდ ჰოსტ სისტემაზე გაშვებას კონტეინერში იზოლირებულად გაშვებას

რა არის AI სენდბოქსი — და რას ნიშნავს მისგან „გასვლა“?

AI სენდბოქსი არის იზოლირებული გარემო, სადაც AI ლაბორატორიები რისკიან კოდსა და საშიშ შესაძლებლობებზე ტესტებს ატარებენ — და 2026 წლის ინციდენტებმა აჩვენა, რომ სენდბოქსიდან რეალური გასვლა შესაძლებელია.

ვრცლად →

OpenAI-მ შიდა AI მოდელს სენდბოქსიდან განმეორებითი გასვლის გამო წვდომა შეუზღუდა

OpenAI-ის თქმით, კომპანიამ ამ კვირას განაცხადა, რომ დროებით შეუზღუდა შიდა წვდომა გამოუქვეყნებელ AI მოდელზე მას შემდეგ, რაც მან არაერთხელ გვერდი აუარა მისი შეკავებისთვის განკუთვნილ სენდბოქსის შეზღუდვებს.

ვრცლად →
თეთრი სახლი — აშშ-ის პრეზიდენტის ოფიციალური რეზიდენცია და სამუშაო ადგილი

რა არის თეთრი სახლის AI-ზე ადრეული წვდომის ჩარჩო?

2026 წლის ივნისის აღმასრულებელი განკარგულებით, აშშ-ის მთავრობას შეუძლია მძლავრი AI მოდელები საჯარო გამოშვებამდე 30 დღით ადრე იხილოს. აი, როგორ მუშაობს ეს ჩარჩო.

ვრცლად →
OpenAI-ის ლოგო — კომპანია, რომელმაც 2023 წელს GPT-4-ისთვის პირველი თანამედროვე სისტემის ბარათი გამოაქვეყნა

რა არის AI სისტემის ბარათი — და რას გვიმხელს სინამდვილეში?

სისტემის ბარათი დოკუმენტია, რომელსაც AI კომპანია ახალ მოდელთან ერთად აქვეყნებს — რას ამხელს ის ტესტირების, რისკებისა და დაცვის მექანიზმების შესახებ?

ვრცლად →
AI Security Institute-ის (AISI) ლოგო მუქ ფონზე

რა არის AI უსაფრთხოების ინსტიტუტი — და რას აკეთებს სინამდვილეში?

სამთავრობო უწყება, რომელიც მძლავრი AI მოდელების საშიშ შესაძლებლობებს გამოშვებამდე ამოწმებს — ყველაზე ახლოს დგას დამოუკიდებელი ინსპექტორის როლთან, რომელიც მოწინავე AI-ს ჰყავს.

ვრცლად →

დიდი ბრიტანეთის უსაფრთხოების ინსტიტუტმა GPT-5.6-ში საყოველთაო ჯეილბრეიქი აღმოაჩინა

OpenAI-ის ახლად გამოქვეყნებული GPT-5.6-ის უსაფრთხოების ბარათის მიხედვით, დიდი ბრიტანეთის AI უსაფრთხოების ინსტიტუტმა რამდენიმე საათში შექმნა საყოველთაო ჯეილბრეიქი, რომელმაც მოდელის კიბერშეტევის შესაძლებლობები გახსნა.

ვრცლად →

რა არის Responsible Scaling Policy — და რატომ ზღუდავენ AI კომპანიები საკუთარ მოდელებს?

Responsible Scaling Policy არის წამყვანი AI კომპანიის საკუთარი წესები იმის შესახებ, როდის ხდება მოდელი იმდენად შესაძლებლობიანი, რომ მისი გამოშვება დამატებითი დაცვის გარეშე საშიშია.

ვრცლად →

რა არის AI უსაფრთხოების ინდექსი — და როგორ აფასებენ კომპანიებს

AI უსაფრთხოების ინდექსი დამოუკიდებელი შეფასების სისტემაა, რომელიც წამყვან AI კომპანიებს რისკის მართვის სერიოზულობის მიხედვით აფასებს. აი, როგორ მუშაობს შეფასება რეალურად.

ვრცლად →