పెద్ద భాషా నమూనాల (LLM) భద్రతపై అంతర్జాతీయ మెషిన్ లెర్నింగ్ కాన్ఫరెన్స్‌లో పరిశోధకుల బృందం ఒక కీలక పత్రాన్ని సమర్పించింది. ఈ సాంకేతికత పని చేసే విధానంలోనే ఒక ప్రాథమిక లోపం ఉందని, దీనివల్ల LLMలను హ్యాక్‌ల నుండి పూర్తిగా రక్షించడం అసాధ్యమని వారు వాదించారు. ప్రభుత్వ, సైనిక వ్యవస్థల నుండి ఆరోగ్య సంరక్షణ వరకు విస్తృతంగా వాడుతున్న ఈ మోడల్స్ భద్రతపై ఈ ఆవిష్కరణ తీవ్ర ప్రభావం చూపుతోంది.

పరిశోధకులు దీనిని 'చైన్-ఆఫ్-థాట్ ఫోర్జరీ' అని పిలుస్తున్నారు. మోడల్స్ తమ ఆలోచనా క్రమంలో రాసుకునే నోట్స్‌ను అనుకరించడం ద్వారా, వాటిని సులభంగా మోసగించవచ్చని వారు కనుగొన్నారు. ఉదాహరణకు, కొకైన్ తయారీ వంటి నిషేధిత సమాచారాన్ని అడిగేటప్పుడు, తాము అనుమతించబడిన విధానాన్ని పాటిస్తున్నట్లుగా మోడల్స్ భ్రమపడేలా ప్రాంప్ట్‌లను రూపొందించారు. OpenAI gpt-oss-20b మోడల్ ఈ తరహా ప్రాంప్ట్‌లకు స్పందించినట్లు పరిశోధకులు పేర్కొన్నారు.

కంపెనీలు సాధారణంగా 'రెడ్-టీమింగ్' ప్రక్రియ ద్వారా మానవ పరీక్షకులు మరియు ఇతర AI మోడల్స్‌ను ఉపయోగించి లోపాలను సరిదిద్దుతుంటాయి. అయితే, ఈ విధానం కేవలం మోడల్‌కు చేయకూడని పనుల జాబితాను ఇవ్వడం వంటిదేనని, ఏ జాబితా కూడా సమగ్రంగా ఉండదని పరిశోధకులు జాస్మిన్ కుయ్ మరియు చార్లెస్ యే హెచ్చరించారు. ఈ లోపం OpenAI మోడల్స్‌తో పాటు ఆంత్రోపిక్, అలీబాబా మరియు డీప్‌సీక్ మోడల్స్‌లో కూడా ఉన్నట్లు వారు గుర్తించారు.

చాట్‌బాట్‌లు టెక్స్ట్‌ను <user>, <assistant>, <system>, మరియు <tool> వంటి ట్యాగ్‌ల ద్వారా వేరు చేస్తాయి. హ్యాకర్లు ఈ ట్యాగ్‌లను తారుమారు చేయడం ద్వారా మోడల్‌ను తప్పుదోవ పట్టిస్తున్నారు. ఈ ఆవిష్కరణ ఆగస్ట్ 2025లో OpenAI నిర్వహించిన రెడ్-టీమింగ్ హ్యాకథాన్‌లో విజేతగా నిలిచింది. ఈ సమస్య ప్రాథమికంగా పరిష్కరించలేనిదిగా మారే అవకాశం ఉందని పరిశోధకులు అభిప్రాయపడుతున్నారు.