పెద్ద భాషా నమూనాల (LLM) భద్రతపై అంతర్జాతీయ మెషిన్ లెర్నింగ్ కాన్ఫరెన్స్లో పరిశోధకుల బృందం ఒక కీలక పత్రాన్ని సమర్పించింది. ఈ సాంకేతికత పని చేసే విధానంలోనే ఒక ప్రాథమిక లోపం ఉందని, దీనివల్ల LLMలను హ్యాక్ల నుండి పూర్తిగా రక్షించడం అసాధ్యమని వారు వాదించారు. ప్రభుత్వ, సైనిక వ్యవస్థల నుండి ఆరోగ్య సంరక్షణ వరకు విస్తృతంగా వాడుతున్న ఈ మోడల్స్ భద్రతపై ఈ ఆవిష్కరణ తీవ్ర ప్రభావం చూపుతోంది.
పరిశోధకులు దీనిని 'చైన్-ఆఫ్-థాట్ ఫోర్జరీ' అని పిలుస్తున్నారు. మోడల్స్ తమ ఆలోచనా క్రమంలో రాసుకునే నోట్స్ను అనుకరించడం ద్వారా, వాటిని సులభంగా మోసగించవచ్చని వారు కనుగొన్నారు. ఉదాహరణకు, కొకైన్ తయారీ వంటి నిషేధిత సమాచారాన్ని అడిగేటప్పుడు, తాము అనుమతించబడిన విధానాన్ని పాటిస్తున్నట్లుగా మోడల్స్ భ్రమపడేలా ప్రాంప్ట్లను రూపొందించారు. OpenAI gpt-oss-20b మోడల్ ఈ తరహా ప్రాంప్ట్లకు స్పందించినట్లు పరిశోధకులు పేర్కొన్నారు.
కంపెనీలు సాధారణంగా 'రెడ్-టీమింగ్' ప్రక్రియ ద్వారా మానవ పరీక్షకులు మరియు ఇతర AI మోడల్స్ను ఉపయోగించి లోపాలను సరిదిద్దుతుంటాయి. అయితే, ఈ విధానం కేవలం మోడల్కు చేయకూడని పనుల జాబితాను ఇవ్వడం వంటిదేనని, ఏ జాబితా కూడా సమగ్రంగా ఉండదని పరిశోధకులు జాస్మిన్ కుయ్ మరియు చార్లెస్ యే హెచ్చరించారు. ఈ లోపం OpenAI మోడల్స్తో పాటు ఆంత్రోపిక్, అలీబాబా మరియు డీప్సీక్ మోడల్స్లో కూడా ఉన్నట్లు వారు గుర్తించారు.
చాట్బాట్లు టెక్స్ట్ను <user>, <assistant>, <system>, మరియు <tool> వంటి ట్యాగ్ల ద్వారా వేరు చేస్తాయి. హ్యాకర్లు ఈ ట్యాగ్లను తారుమారు చేయడం ద్వారా మోడల్ను తప్పుదోవ పట్టిస్తున్నారు. ఈ ఆవిష్కరణ ఆగస్ట్ 2025లో OpenAI నిర్వహించిన రెడ్-టీమింగ్ హ్యాకథాన్లో విజేతగా నిలిచింది. ఈ సమస్య ప్రాథమికంగా పరిష్కరించలేనిదిగా మారే అవకాశం ఉందని పరిశోధకులు అభిప్రాయపడుతున్నారు.







