การเปลี่ยนการวิจัยด้านปัญญาประดิษฐ์ให้เป็นเครื่องมือในโลกแห่งความเป็นจริงไม่ใช่เรื่องง่ายเสมอไป แม้ว่าจะมีความก้าวหน้าอย่างน่าทึ่งในช่วงไม่กี่ปีที่ผ่านมา ตั้งแต่รถยนต์ที่ขับเคลื่อนด้วยตนเองไปจนถึงโมเดลภาษาขนาดใหญ่ ระบบที่ทำงานได้ดีในสภาพแวดล้อมของห้องปฏิบัติการที่มีการควบคุมมักจะขาดเมื่อใช้งานในบ้าน โรงพยาบาล หรือบนถนนในเมือง
ตัวอย่างเช่น ระบบที่ใช้การมองเห็น สัญญาว่าจะปรับปรุงความปลอดภัย ติดตามสุขภาพ และช่วยเหลือการฟื้นฟู ตัวอย่างเช่น ระบบที่ใช้กล้องสามารถช่วยให้แพทย์ประเมินการเดินของผู้ป่วยหรือความคืบหน้าในการฟื้นฟูสมรรถภาพได้
ในอนาคต ผู้ช่วยหุ่นยนต์ในบ้านของผู้สูงอายุอาจจำเป็นต้องรับรู้เมื่อบุคคลนั้นมีปัญหาในการยืนหรือเข้าถึงวัตถุ แต่ความท้าทายที่สำคัญคือการทำให้หุ่นยนต์เหล่านี้ทำงานนอกห้องปฏิบัติการได้อย่างน่าเชื่อถือ โดยเฉพาะอย่างยิ่งในสภาวะที่ยุ่งเหยิง คาดเดาไม่ได้ หรือทัศนวิสัยต่ำ
ในฐานะนักวิทยาศาสตร์คอมพิวเตอร์ที่ศึกษาระบบ AI ที่ออกแบบมาเพื่อเข้าใจพฤติกรรมของมนุษย์ โดยเฉพาะอย่างยิ่งผ่านการมองเห็น เช่น การเคลื่อนไหวของร่างกาย และการโต้ตอบกับวัตถุ ฉันมองเห็นความท้าทายหลักสามประการในการนำ AI จากห้องปฏิบัติการไปสู่โลกแห่งความเป็นจริง: ลักษณะทั่วไป พฤติกรรมของมนุษย์ และความสามารถ
ความท้าทายที่ 1: ช่องว่างทั่วไป
ระบบการมองเห็น AI ส่วนใหญ่ได้รับการฝึกฝนกับภาพที่มีแสงสว่างเพียงพอและมีคุณภาพสูง ซึ่งมักจะมาจากแหล่งที่เลือก เช่น สตูดิโอจับภาพเคลื่อนไหวหรือการบันทึกในเวลากลางวัน แต่เมื่อระบบเหล่านี้ถูกนำไปใช้ในสภาพแวดล้อมจริง เช่น บ้านที่มีแสงสว่างไม่เพียงพอ ห้องในโรงพยาบาล หรือถนนในเวลากลางคืน ก็มักจะเผชิญกับความยากลำบาก ไม่ใช่เพราะเทคโนโลยีมีข้อบกพร่อง แต่เป็นเพราะข้อมูลที่ใช้ในการฝึกอบรมจึงไม่สามารถแสดงถึงความแปรปรวนมหาศาลของโลกแห่งความเป็นจริงได้อย่างเต็มที่
ยกตัวอย่างเช่น การประมาณท่าทางของมนุษย์ งานนี้เกี่ยวข้องกับการตรวจหาจุดสำคัญบนร่างกายของบุคคล เช่น ข้อต่อ เพื่อทำความเข้าใจว่าจุดเหล่านั้นเคลื่อนไหวอย่างไร ผลลัพธ์ที่ได้จะคล้ายกับโครงกระดูกดิจิทัลที่แสดงถึงตำแหน่งของแขน ขา และส่วนอื่นๆ ของร่างกาย การประมาณท่าทางได้รับการศึกษาสำหรับการใช้งานด้านการดูแลสุขภาพและการฟื้นฟูสมรรถภาพ รวมถึงการวัดการเดินของบุคคล การติดตามการออกกำลังกายเพื่อการฟื้นฟู และการประเมินรูปแบบการเคลื่อนไหวที่เกี่ยวข้องกับความเสี่ยงในการล้ม ในสภาพแวดล้อมที่มีแสงสว่างเพียงพอ โมเดล AI สมัยใหม่สามารถทำได้ด้วยความแม่นยำที่น่าประทับใจ แต่ในสภาพแสงที่ไม่ดีหรือไม่สม่ำเสมอ ประสิทธิภาพอาจลดลงอย่างมาก เนื่องจากโมเดลเรียนรู้จากข้อมูลที่ชัดเจนและสม่ำเสมอ และไม่ได้เตรียมที่จะสรุปสภาวะที่ยากขึ้น
การรวบรวมข้อมูลการฝึกอบรมในเวลากลางคืนมากขึ้นจะช่วยแก้ปัญหาได้หรือไม่ ข้อมูลที่มีป้ายกำกับเพิ่มเติมจะช่วยได้อย่างแน่นอน แต่การรวบรวมข้อมูลนั้นยากเป็นพิเศษ เมื่อข้อต่อของบุคคลมองเห็นได้ยากในภาพ ก็เป็นเรื่องยากที่ผู้อธิบายประกอบที่เป็นมนุษย์จะติดป้ายกำกับให้ถูกต้องแม่นยำเช่นกัน แสงน้อยยังสามารถบดบังข้อมูลภาพได้มากกว่าแค่ทำให้ภาพมืดลง และสภาพในเวลากลางคืนจะแตกต่างกันไปขึ้นอยู่กับกล้อง เงา แสงสะท้อน และแหล่งที่มาของสัญญาณรบกวนอื่นๆ การรวบรวมและติดฉลากตัวอย่างที่ครอบคลุมเงื่อนไขทั้งหมดด้วยตนเองจึงเป็นเรื่องยากและมีราคาแพง
เรากำลังดำเนินการเพื่อเติมเต็มช่องว่างนี้โดยการพัฒนาระบบ AI ที่ทำงานได้ดีขึ้นในสถานการณ์ที่มีแสงน้อย วิธีหนึ่งที่เราใช้คือการปรับโดเมนแบบไม่มีผู้ดูแล โดยที่แบบจำลองที่ได้รับการฝึกเกี่ยวกับข้อมูลที่มีแสงสว่างเพียงพอและมีป้ายกำกับจะถูกปรับให้เข้ากับการตั้งค่าที่มีแสงน้อย โดยไม่จำเป็นต้องติดป้ายกำกับด้วยตนเองสำหรับข้อต่อของร่างกายสำหรับภาพที่มีแสงน้อย ซึ่งจะช่วยเชื่อม “ช่องว่างโดเมน” ระหว่างข้อมูลการฝึกอบรมที่สะอาดกับโลกที่ยุ่งวุ่นวายกว่าที่ระบบเหล่านี้ถูกใช้งานจริง
ในการศึกษาปี 2026 เกี่ยวกับการประมาณท่าทางของมนุษย์ในสภาพแสงน้อย เราได้สร้างภาพการฝึกในสภาพแสงน้อยที่สมจริง และออกแบบระบบเพื่อสร้างสมดุลระหว่างหลักฐานทางการมองเห็นที่ไม่แน่นอนกับความรู้ที่เรียนรู้เกี่ยวกับโครงสร้างร่างกายมนุษย์ วิธีการนี้ปรับปรุงประสิทธิภาพอย่างมากในการวัดประสิทธิภาพที่มีแสงน้อยสองตัว แม้ว่าความท้าทายในวงกว้างนั้นยังห่างไกลจากการแก้ไข

ความท้าทายที่ 2: พฤติกรรมของมนุษย์
อุปสรรคสำคัญอีกประการหนึ่งคือพฤติกรรมที่หลากหลายของมนุษย์ โดยเฉพาะเมื่อผู้คนมีปฏิสัมพันธ์กับวัตถุ ในการมองเห็นด้วยคอมพิวเตอร์ สิ่งนี้เรียกว่าการตรวจจับปฏิสัมพันธ์ระหว่างมนุษย์กับวัตถุ การสอนระบบ AI ให้จดจำการกระทำต่างๆ เช่น การตัดมะเขือเทศหรือส่งลูกบาสเก็ตบอล ไม่เพียงแต่ต้องอาศัยการตรวจจับวัตถุเท่านั้น แต่ยังต้องเข้าใจบริบทและเจตนาอีกด้วย
ความท้าทายที่แท้จริงคือขนาด วัตถุมีจำนวนมาก และวิธีที่มนุษย์โต้ตอบกับวัตถุนั้นมีมากกว่านั้นอีก คุณสามารถนั่งบนเก้าอี้ อุ้ม ลาก หรือวางซ้อนกันได้ แต่ละคนมีปฏิสัมพันธ์ที่แตกต่างกัน ถ้วยสามารถใช้ดื่ม ล้าง เสิร์ฟ หรือมอบสิ่งของให้ผู้อื่นได้ หุ่นยนต์ช่วยเหลือจะต้องแยกแยะระหว่างการกระทำเหล่านี้เพื่อตอบสนองอย่างเหมาะสม การรวบรวมและติดป้ายกำกับข้อมูลสำหรับชุดค่าผสมที่เป็นไปได้ทั้งหมดนั้นเป็นไปไม่ได้
ในการวิจัยของฉัน เราศึกษาว่าระบบ AI สามารถตรวจจับการโต้ตอบที่ไม่เคยเห็นระหว่างการฝึกได้อย่างไร นักวิจัยเรียกสิ่งนี้ว่าปัญหาทั่วไปสำหรับคลาสที่มองไม่เห็น และเป็นความท้าทายพื้นฐานสำหรับการสร้างแบบจำลองที่ไม่เพียงแต่จดจำรูปแบบเท่านั้น แต่ยังสามารถปรับให้เข้ากับสถานการณ์ใหม่ได้ งานของเราสำรวจว่าแบบจำลองพื้นฐานสามารถช่วยจดจำการโต้ตอบที่ไม่เคยพบเห็นมาก่อนได้อย่างไร ในการศึกษาล่าสุด เราใช้แบบจำลองภาษาการมองเห็นขนาดใหญ่ ซึ่งเป็นแบบจำลองที่รวมการมองเห็นของคอมพิวเตอร์และการประมวลผลภาษาธรรมชาติ เพื่อระบุส่วนของวัตถุที่สนับสนุนการกระทำเฉพาะ โดยไม่ต้องฝึกอบรมระบบในตัวอย่างที่ติดป้ายกำกับสำหรับงานเฉพาะนั้น นี่เป็นสิ่งสำคัญในด้านต่างๆ เช่น หุ่นยนต์ช่วยเหลือและการตรวจสอบความปลอดภัย ซึ่ง AI จำเป็นต้องตอบสนองต่อพฤติกรรมที่ไม่ได้รับการฝึกอบรมมาโดยเฉพาะอย่างชาญฉลาด
ความท้าทายนี้แตกต่างจากปัญหาแสงน้อย ในการประมาณค่าท่าทางในที่แสงน้อย ระบบจะพยายามจดจำการเคลื่อนไหวประเภทที่คุ้นเคยภายใต้สภาพแวดล้อมที่ไม่คุ้นเคย ในการตรวจจับการโต้ตอบระหว่างมนุษย์กับวัตถุ การผสมผสานระหว่างการกระทำกับวัตถุอาจเป็นสิ่งใหม่ ทั้งสองเป็นปัญหาลักษณะทั่วไป แต่ต้องการวิธีแก้ไขที่แตกต่างกัน

ความท้าทายที่ 3: ช่องว่างทรัพยากร
แม้ว่านักวิจัยจะรู้วิธีสร้างแบบจำลองให้มีประสิทธิภาพมากขึ้น แต่การนำการปรับปรุงเหล่านี้ไปใช้ไม่ใช่เรื่องง่ายเสมอไป โดยเฉพาะอย่างยิ่งในสภาพแวดล้อมทางวิชาการหรือการวิจัยที่มีขนาดเล็กลง ระบบ AI ที่ทรงพลังที่สุดในปัจจุบันอาศัยทรัพยากรการประมวลผลจำนวนมหาศาลในรูปแบบของศูนย์ข้อมูลที่มีชิปคอมพิวเตอร์เฉพาะทางจำนวนมาก
สิ่งเหล่านี้มักจะมีราคาแพงเกินไปสำหรับห้องปฏิบัติการของมหาวิทยาลัยหรือนักวิจัยในภาครัฐ และพลังการคำนวณที่จำเป็นในการฝึกอบรมโมเดลชั้นนำยังคงเพิ่มขึ้นอย่างต่อเนื่อง ตามรายงานดัชนี AI ปี 2026 อุตสาหกรรมเทคโนโลยีผลิตโมเดล AI ที่โดดเด่นมากกว่า 90% ที่เปิดตัวในปี 2025
ในเวลาเดียวกัน โมเดลที่พัฒนาโดยใช้คลัสเตอร์คอมพิวเตอร์ขนาดใหญ่อาจจำเป็นต้องดำเนินการในคลินิก โรงเรียน หุ่นยนต์ หรืออุปกรณ์ในบ้านในท้ายที่สุด ซึ่งหมายถึงการทำงานบนฮาร์ดแวร์ที่มีขนาดเล็กกว่ามาก ระบบเหล่านี้อาจต้องตอบสนองอย่างรวดเร็วโดยไม่ต้องส่งข้อมูลสำคัญไปยังคลาวด์อย่างต่อเนื่อง ความไม่ลงรอยกันนี้ทำให้เกิดช่องว่างที่กว้างขึ้นเรื่อยๆ ระหว่างสิ่งที่เป็นไปได้ในทางทฤษฎีกับสิ่งที่ปฏิบัติได้จริงในการนำไปปฏิบัติ การเชื่อมโยงช่องว่างนี้ไม่เพียงต้องการโมเดลที่ดีกว่าเท่านั้น แต่ยังต้องมีอัลกอริธึมที่มีประสิทธิภาพมากขึ้นและเครื่องมือโอเพ่นซอร์สที่ขยายการเข้าถึง AI ขั้นสูง

ทำไมเรื่องนี้ถึงสำคัญ
ความท้าทายเหล่านี้ไม่ใช่แค่เรื่องวิชาการเท่านั้น สิ่งเหล่านี้ส่งผลต่อวิธีการและความน่าเชื่อถือของเครื่องมือ AI ในโลกแห่งความเป็นจริง ลองนึกภาพระบบตรวจจับการล้มที่ทำงานผิดพลาดในเวลากลางคืน อุปกรณ์ตรวจสอบความปลอดภัยในสถานที่ทำงานที่พลาดการดำเนินการที่สำคัญ หรือหุ่นยนต์ที่เข้าใจผิดว่าบุคคลกำลังทำอะไรอยู่เนื่องจากไม่เคยเห็นการโต้ตอบที่แน่นอนดังกล่าวมาก่อน สิ่งเหล่านี้ไม่ได้เป็นเพียงข้อบกพร่องเล็กๆ น้อยๆ เท่านั้น แต่ยังเป็นข้อบกพร่องในด้านความน่าเชื่อถือ การใช้งาน และบางครั้งก็แม้แต่เรื่องความปลอดภัยด้วย
มีการปรับใช้ระบบ AI ในบ้าน โรงพยาบาล โรงงาน ยานพาหนะ และสภาพแวดล้อมอื่นๆ ในชีวิตประจำวัน หากไม่สามารถปรับตัวเข้ากับสภาพแวดล้อมที่แตกต่างกันหรือรับรู้ถึงพฤติกรรมใหม่ๆ ของมนุษย์ ประโยชน์ของสิ่งเหล่านี้ก็จะถูกจำกัดและความเสี่ยงก็เพิ่มขึ้น นั่นเป็นเหตุผลที่นักวิจัยมุ่งเน้นมากขึ้นเรื่อยๆ ไม่เพียงแต่ความแม่นยำภายใต้สภาวะที่เหมาะสมเท่านั้น แต่ยังรวมถึงความแข็งแกร่ง ภาพรวม และความพร้อมในโลกแห่งความเป็นจริงด้วย

มองไปสู่อนาคต: ปิดช่องว่าง
การปิดช่องว่างระหว่างโมเดล AI ที่ได้รับการฝึกในห้องปฏิบัติการกับสภาพแวดล้อมในโลกแห่งความเป็นจริงที่ยุ่งเหยิงและคาดเดาไม่ได้จะไม่เกิดขึ้นชั่วข้ามคืน แต่เป็นไปได้ ในการวิจัยของฉัน เราสำรวจเทคนิคต่างๆ เช่น การใช้ข้อมูลเสริมเพื่อจำลองสภาวะที่ท้าทายและช่วยให้โมเดลปรับตัวได้ นอกจากนี้เรายังทำงานเพื่อให้ระบบ AI สามารถสรุปสถานการณ์ใหม่และที่มองไม่เห็นได้ดีขึ้น โดยใช้ความรู้จากแบบจำลองพื้นฐานเพื่อแยกแยะการโต้ตอบที่ไม่รู้จักจากการโต้ตอบที่คล้ายกันซึ่งพบระหว่างการฝึกอบรม
ท้ายที่สุดแล้ว ฉันเชื่อว่าการทำให้ระบบ AI เชื่อถือได้มากขึ้นในสภาพแวดล้อมในชีวิตประจำวันถือเป็นความท้าทายที่คุ้มค่าในการแก้ไข ไม่ใช่แค่การปรับปรุงอุปกรณ์และแอปพลิเคชันเท่านั้น แต่เนื่องจาก AI มีศักยภาพในการสนับสนุนความเป็นอยู่ที่ดีของมนุษย์ ไม่ว่านั่นหมายถึงถนนที่ปลอดภัยยิ่งขึ้น การดูแลสุขภาพที่ชาญฉลาดยิ่งขึ้น หรือบ้านที่ปลอดภัยยิ่งขึ้น
Bo Wang ผู้ช่วยศาสตราจารย์สาขาวิทยาการคอมพิวเตอร์และสารสนเทศ มหาวิทยาลัยมิสซิสซิปปี้
บทความนี้เผยแพร่ซ้ำจาก The Conversation ภายใต้ใบอนุญาต Creative Commons อ่านบทความต้นฉบับที่นี่: