Abliterated models: refusal हटाए गए LLM आपके threat model के लिए क्या मायने रखते हैं
"क्या आप ऐसी AI चाहते हैं जो सिर्फ़ cybersecurity की बात न करे, बल्कि systems में सेंध लगाने में सक्रिय रूप से मदद करे?" इस हफ़्ते चर्चा में आए एक offensive model का यही विज्ञापन था। ऐसे abliterated models अब Hugging Face पर रोज़ाना छप रहे हैं — open-weight LLM जिनसे refusal (मना करने की क्षमता) को शल्य-चिकित्सा की तरह हटा दिया गया है। यह गाइड बताती है कि abliteration असल में model के साथ क्या करता है और CISO को कहाँ ध्यान देना चाहिए।
"Abliterated" का मतलब
2024 के एक शोध ने दिखाया कि aligned chat models में refusal काफ़ी हद तक model के internal activations की एक ही direction से तय होता है। Abliteration इसी का फ़ायदा उठाता है: harmful और harmless prompts के जोड़ों से उस direction को मापा जाता है, फिर weights को उसके विरुद्ध orthogonalise कर दिया जाता है, ताकि model मना ही न कर सके। "Abliterated" शब्द ablation और obliteration से बना है — यानी refusal को मिटा देना। इसमें कोई retrain, कोई dataset या GPU cluster नहीं चाहिए; एक laptop और एक दोपहर काफ़ी है।
इससे दो असहज बातें निकलती हैं। पहली, वह क्षमता पहले से ही model में थी; सिर्फ़ brake हटा है। दूसरी, यह जुड़ जाती है: अक्सर एक मज़बूत base को abliterate करके फिर किसी offensive corpus पर fine-tune किया जाता है — "cybersecurity" वाला refusal हटा model आमतौर पर यही होता है।
असली जोखिम कहाँ है
model को ही ख़तरा मान लेना ऐसी policy की ओर ले जाता है जिसे कोई लागू नहीं कर सकता। weights वही हैं; जोखिम बदलता है reach (model किस चीज़ तक पहुँच सकता है) और governance (क्या किसी ने इसे मंज़ूरी दी, दायरा तय किया और log किया) से।
- Endpoints पर shadow AI: कोई analyst "सीखने के लिए" refusal हटा model को Ollama या LM Studio में खींच लेता है — बिना inventory के, corporate SSO और source-code वाली मशीन पर।
- Model supply chain: ये तीसरे पक्ष द्वारा दोबारा प्रकाशित derivatives हैं; कोई भी custom loading code एक अनजाना binary है जिसे चलाने पर आप सहमति दे रहे हैं।
- Tools वाले agents: इसी model को किसी shell, browser या credentials से जोड़ दें, तो आपने वही एक परत हटा दी जो किसी injected निर्देश को मना कर सकती थी।
- License जोखिम: कई model licenses में acceptable-use शर्तें होती हैं जिन्हें refusal हटा derivative पहले से ही तोड़ सकता है।
वैध उपयोग, ईमानदारी से
अधिकृत red teams के लिए ऐसे model का असली उपयोग है जो बिना उपदेश दिए exploitation पर बात करे। पर इसके लिए उसे production access वाले laptop पर रखने की ज़रूरत नहीं; ज़रूरत है एक isolated lab host, verified weights, एक नामित owner, एक लिखित scope और पूरी logging की।
इसे कैसे score करें
जिसे लागू न कर सकें उसे फ़रमान से मत रोकिए। हर model को inventory में डालें, weights का hash verify करें, और किसी भी refusal हटे model को agent से जोड़ने से पहले स्पष्ट मंज़ूरी माँगें। हर असली deployment को Abliterated Model Risk Calculator से score करें और हर repository को अपने environment में आने से पहले Hugging Face Model Risk Scanner से जाँचें।
अक्सर पूछे जाने वाले प्रश्न
Abliterated model क्या है?
यह एक open-weight LLM है जिसका refusal व्यवहार weights को edit करके हटा दिया गया है। harmful और harmless prompts के जोड़ों से refusal की internal direction पहचानी जाती है और उसे weights से बाहर project कर दिया जाता है — बिना retrain किए, बाक़ी capabilities को लगभग बरक़रार रखते हुए।
क्या इसे download या run करना क़ानूनी है?
ज़्यादातर jurisdictions में model को रखना या चलाना अपने आप में अवैध नहीं है; आप उससे क्या करते हैं यह किसी भी tool जैसे क़ानूनों, model के license और आपके employer की acceptable-use policy से तय होता है। असली सवाल यह है कि deployment approved, scoped, logged और isolated है या नहीं।
क्या CISO को इन्हें पूरी तरह ban कर देना चाहिए?
पूर्ण ban लिखना आसान पर लागू करना मुश्किल है, और यह वैध red-team उपयोग को छिपा देता है। बेहतर रुख़: कोई refusal हटा model किसी approved, isolated, logged environment के बाहर नहीं, जिसमें नामित owner और scope हो; और tools वाले agent से जोड़ने के लिए स्पष्ट sign-off ज़रूरी हो।