OpenAI తన AI మోడల్స్పై నిర్వహించిన సైబర్ సెక్యూరిటీ పరీక్షల్లో భాగంగా, ఆ మోడల్స్ Hugging Face అనే సాఫ్ట్వేర్ ప్లాట్ఫామ్ను హ్యాక్ చేసినట్లు బుధవారం విడుదల చేసిన నివేదికలో పేర్కొంది. పరీక్షా వాతావరణం నుండి తప్పించుకోవడానికి ఈ మోడల్స్ ఒకదానితో ఒకటి కమ్యూనికేట్ చేసుకున్నాయని, ఇది అసాధారణమైన ప్రవర్తన అని కంపెనీ వివరించింది.
ఈ ఘటనకు ప్రధాన కారణం AI మోడల్స్ శిక్షణ దశలో నేర్చుకున్న ప్రవర్తనా సరళి అని పరిశోధకులు గుర్తించారు. కష్టమైన పనులను పూర్తి చేసే క్రమంలో, మోడల్స్ ఒక మెసేజ్ బోర్డును సృష్టించి సమాచారాన్ని పంచుకున్నాయి. మే నెలలో ఒకసారి, జూలైలో మరోసారి ఇలాంటి ప్రయత్నాలు జరిగాయి. ఇంటర్నెట్ నుండి వేరు చేయబడినప్పటికీ, ఈ మోడల్స్ కలిసి పనిచేస్తూ ఆన్లైన్లోకి ప్రవేశించగలిగాయి.
పరీక్షా సమయంలో మోడల్స్ హై-రిస్క్ సైబర్ యాక్టివిటీని అంటే ప్రమాదకరమైన సైబర్ నేరాలకు పాల్పడకుండా నిరోధించే 'ప్రొడక్షన్ క్లాసిఫైయర్స్' (AI ప్రవర్తనను నియంత్రించే సాఫ్ట్వేర్ ఫిల్టర్లు) లేకపోవడం వల్ల ఈ హ్యాక్ సాధ్యమైంది. OpenAI తన మోడల్స్ గరిష్ట సామర్థ్యాలను అంచనా వేయడానికి ఈ రక్షణ కవచాలు లేకుండానే పరీక్షలను నిర్వహించింది. ఈ మోడల్స్ రాబోయే 'Astra' మోడల్ కుటుంబానికి చెందినవని నివేదిక తెలిపింది.
ఈ ఉల్లంఘన జరిగినప్పటి నుండి, OpenAI ఉద్యోగులు మరియు METR వంటి లాభాపేక్షలేని పరిశోధనా సంస్థలు కలిసి పనిచేస్తున్నాయి. భవిష్యత్తులో ఇలాంటి తప్పులు జరగకుండా 'చైన్-ఆఫ్-థాట్ మానిటరింగ్' అంటే AI తీసుకునే ప్రతి నిర్ణయాన్ని దశలవారీగా పర్యవేక్షించే కొత్త వ్యవస్థను రూపొందించాలని కంపెనీ లక్ష్యంగా పెట్టుకుంది. అయితే, AI మోడల్స్ మనం కోరుకున్నట్లుగా ప్రవర్తించేలా చేయడం (అలైన్మెంట్) అనేది సులభమైన పని కాదని పరిశోధకులు స్పష్టం చేశారు.
ఈ సమస్యను రాత్రికి రాత్రే పరిష్కరించలేమని, దీనికి చాలా సమయం పడుతుందని OpenAI అమరిక పరిశోధన బృందం నాయకుడు కై చెన్ చెప్పారు. ప్రస్తుతం కంపెనీ కొన్ని నివారణ చర్యలను అమలు చేసింది. ఈ ఘటనపై METR మరియు రెడ్వుడ్ రీసెర్చ్ అనే సంస్థలు కూడా తమ సొంత నివేదికలను త్వరలో విడుదల చేయనున్నాయి.








