AI Guardrails กำลังขัดขวางการทำงานของนักวิจัยความปลอดภัยทางไซเบอร์เชิงรุก

หัวข้อ: AI Guardrails กำลังขัดขวางการทำงานของนักวิจัยความปลอดภัยทางไซเบอร์เชิงรุก
เป็นเวลาหลายเดือนที่ยักษ์ใหญ่ด้าน AI ได้พัฒนาโปรแกรมที่ผ่านการคัดกรองพิเศษและมาตรการป้องกันที่เข้มงวด (guardrails) เพื่อจำกัดการใช้โมเดลของตนโดยแฮกเกอร์ที่ประสงค์ร้าย แต่ข้อจำกัดเหล่านี้กำลังขัดขวางการทำงานของผู้ปกป้องเครือข่ายที่ถูกต้องตามกฎหมาย รวมถึงนักวิจัยความปลอดภัยทางไซเบอร์เชิงรุก (offensive cybersecurity researchers) ในเดือนมิถุนายน รัฐบาลสหรัฐฯ ได้กำหนดข้อจำกัดการควบคุมการส่งออก (export control restrictions) ต่อโมเดล AI ที่ได้รับการโปรโมทอย่างมากของ Anthropic อย่าง Mythos และ Fable การดำเนินการนี้เกิดขึ้นอย่างน้อยบางส่วนจากรายงานที่อ้างว่าสามารถหลีกเลี่ยง guardrails ของโมเดลที่ออกแบบมาเพื่อป้องกันไม่ให้ผู้ใช้ใช้โมเดลเหล่านี้ในการสร้างและดำเนินการโจมตีทางไซเบอร์ที่เป็นอันตราย ไม่ว่าเหตุการณ์นี้จะเกิดจากความกลัวการเจลเบรก (jailbreak) หรือไม่ ความจริงก็คือ Anthropic ได้ทำการตลาด Mythos ซ้ำแล้วซ้ำเล่าในฐานะเครื่องจักรไซเบอร์แห่งวันสิ้นโลก (doomsday cybermachine) ที่สามารถมอบให้เฉพาะผู้ใช้ที่ผ่านการคัดกรองอย่างรอบคอบเท่านั้น และถึงอย่างนั้นก็ยังมี guardrails ที่เข้มงวด (ข้อจำกัดการส่งออกของ Fable 5 และ Mythos 5 ได้ถูกยกเลิกตั้งแต่นั้น Fable 5 กลับมาให้บริการทั่วไปในวันที่ 1 กรกฎาคม ส่วน Mythos 5 ได้ถูกนำกลับมาให้เฉพาะองค์กรสหรัฐฯ ที่ผ่านการคัดกรองเท่านั้น ซึ่งเป็นส่วนหนึ่งของกระบวนการตรวจสอบของรัฐบาล) การควบคุมการเข้าถึงแบบนี้ไม่ได้มีเฉพาะใน Mythos เท่านั้น ทั้ง Anthropic กับโมเดลอื่นๆ และ OpenAI เสนอโปรแกรมสำหรับนักวิจัยความปลอดภัยทางไซเบอร์ที่สามารถสมัครเพื่อรับการคัดกรอง และหากได้รับการอนุมัติ ก็จะสามารถเข้าถึงโมเดลที่มีข้อจำกัดด้านความปลอดภัยทางไซเบอร์น้อยกว่า: โปรแกรม Trusted Access for Cyber ของ OpenAI และโปรแกรม Cyber Verification Program ของ Anthropic guardrails เหล่านี้ถูกวิพากษ์วิจารณ์อย่างกว้างขวาง โดยเฉพาะจากนักวิจัยที่มีหน้าที่ค้นหาช่องโหว่ที่ไม่รู้จักในระบบและพัฒนาวิธีการโจมตีก่อนที่อาชญากรจะทำได้ ในการปรากฏตัวล่าสุดในพอดแคสต์ด้านความปลอดภัยทางไซเบอร์ Mark Dowd นักวิจัยความปลอดภัยที่มีชื่อเสียงกล่าวว่า “มันไม่สบายใจสำหรับผมที่บริษัทใหญ่ๆ สุ่มเหล่านี้กำลังตัดสินใจตามอำเภอใจว่าอะไรปลอดภัยในด้านความปลอดภัยและอะไรไม่ปลอดภัย” Dowd ใช้เวลาหลายทศวรรษในการค้นหาและขาย “zero-days” — ข้อบกพร่องของซอฟต์แวร์ที่ไม่เคยรู้มาก่อนและช่องโหว่ที่ใช้ประโยชน์จากมัน — ให้กับรัฐบาลตะวันตก แทนที่จะรายงานให้ผู้ผลิตซอฟต์แวร์ทราบเพื่อให้ได้รับการแก้ไข รัฐบาลจ่ายเงินพรีเมียมสำหรับช่องโหว่เพราะมันยังคงเปิดอยู่ ซึ่งมีประโยชน์สำหรับปฏิบัติการข่าวกรอง Dowd ยอมรับว่างานของเขาอาจทำให้เขามีอคติ แต่เขาไม่ได้อยู่คนเดียว หลายคนที่ทำงานด้านความปลอดภัยทางไซเบอร์เชิงรุก — พวกเขาตรวจสอบระบบเพื่อหาจุดอ่อนอย่างเชิงรุก — อธิบายให้ TechCrunch ฟังว่าพวกเขาใช้เครื่องมือ AI และจัดการกับ guardrails อย่างไร Chris Anley หัวหน้านักวิทยาศาสตร์ของ NCC Group ที่ปรึกษาด้านความปลอดภัยรายใหญ่ กล่าวว่าการถามโมเดล AI ให้พยายามใช้ประโยชน์จากบั๊กเป็นขั้นตอนสำคัญในการยืนยันว่ามันเป็นช่องโหว่จริงที่ควรแก้ไข แต่ถ้า guardrail ทำให้โมเดลปฏิเสธที่จะตอบคำถามโดยตรง guardrail ก็จะทำร้ายผู้ป้องกัน เขากล่าว “นี่คือจุดที่เรื่องทั้งหมดเกี่ยวกับการรุกและการป้องกันและ guardrails เข้ามา เพราะ ‘แก้ไขโค้ดนี้’ ในฐานะพรอมต์ (prompt) เป็นทั้งกลไกสำคัญสำหรับการป้องกัน แต่ก็เป็น
แหล่งที่มา: techcrunch
คำศัพท์เทคนิคที่น่าสนใจ
- AI – ปัญญาประดิษฐ์ – เทคโนโลยีที่ทำให้คอมพิวเตอร์สามารถคิด เรียนรู้ และตัดสินใจได้คล้ายมนุษย์
- guardrails – ข้อจำกัดหรือมาตรการป้องกันที่ตั้งไว้เพื่อควบคุมการใช้งานระบบ ไม่ให้ถูกนำไปใช้ในทางที่ผิด
- offensive cybersecurity researchers – นักวิจัยความปลอดภัยทางไซเบอร์เชิงรุก – ผู้ที่พยายามเจาะระบบหรือค้นหาจุดอ่อนเพื่อป้องกันก่อนที่ผู้ไม่หวังดีจะทำ
- export control restrictions – ข้อจำกัดการควบคุมการส่งออก – กฎหมายที่รัฐบาลใช้ควบคุมการส่งออกเทคโนโลยีหรือสินค้าที่อาจเป็นอันตรายไปต่างประเทศ
- jailbreak – การเจลเบรก – การหลีกเลี่ยงข้อจำกัดของระบบเพื่อให้สามารถทำสิ่งที่ถูกห้ามหรือจำกัดไว้
- doomsday cybermachine – เครื่องจักรไซเบอร์แห่งวันสิ้นโลก – ระบบ AI ที่ทรงพลังมากจนอาจก่อให้เกิดภัยพิบัติทางไซเบอร์หากถูกใช้ผิดวัตถุประสงค์
- zero-days – ช่องโหว่หรือข้อบกพร่องของซอฟต์แวร์ที่ยังไม่มีใครรู้จักมาก่อน และยังไม่มีการแก้ไข
- bug – บั๊ก – ข้อผิดพลาดหรือจุดบกพร่องในซอฟต์แวร์ที่ทำให้ทำงานผิดปกติ
- prompt – พรอมต์ – คำสั่ง คำถาม หรือข้อความที่ผู้ใช้ป้อนให้ AI เพื่อให้ตอบสนองหรือทำงานตามที่ต้องการ