ปิดโฆษณา

Apple ในงานวิจัยฉบับใหม่นี้ พวกเขาแสดงให้เห็นว่าโมเดลภาษาขนาดใหญ่ (LLM) สามารถใช้วิเคราะห์ข้อมูลเสียงและการเคลื่อนไหวเพื่อรับรู้การกระทำของผู้ใช้ได้อย่างแม่นยำยิ่งขึ้น ผู้เขียนระบุว่า LLM สามารถปรับปรุงการตีความข้อมูลทางประสาทสัมผัสได้อย่างมีนัยสำคัญ แม้ในสถานการณ์ที่มีข้อมูลเพียงเล็กน้อย miniคุณแม่ งานวิจัยที่มีชื่อว่า การใช้ LLMs สำหรับ Late Multimodal Sensor Fusion for Activity Recognition ศึกษาว่าแบบจำลองภาษาสามารถผสานเข้ากับเซ็นเซอร์แบบดั้งเดิม (เช่น ไมโครโฟน) ได้อย่างไรone(เช่น เซ็นเซอร์ตรวจจับความเคลื่อนไหว) และทำให้เข้าใจบริบทกิจกรรมของผู้ใช้ได้ดียิ่งขึ้น นักวิจัยอธิบายว่าแม้จะไม่มีการฝึกอบรมพิเศษ แต่หลักสูตรนิติศาสตรมหาบัณฑิต (LLM) ก็สามารถระบุสิ่งที่บุคคลกำลังทำได้อย่างแม่นยำยิ่งขึ้น และอัตราความสำเร็จจะยิ่งเพิ่มขึ้นเมื่อเสริมด้วยกรณีตัวอย่างเพียงกรณีเดียว

อย่างไรก็ตาม สิ่งสำคัญคือแบบจำลองในการศึกษานี้ไม่ได้รับข้อมูลดิบ audio แต่มีเพียงคำอธิบายสั้นๆ ที่สร้างจากแบบจำลองแยกกันสำหรับเสียงและการเคลื่อนที่ เซ็นเซอร์ตรวจจับการเคลื่อนไหว (เครื่องวัดความเร่งและไจโรสโคป) จึงสร้างข้อความสรุปขึ้นมา ซึ่ง LLM ได้นำมาใช้งานต่อ Apple ใช้ชุดข้อมูล Ego4D ซึ่งเป็นชุดวิดีโอบันทึกมุมมองบุคคลที่หนึ่งจำนวนมาก นักวิจัยได้เลือกกิจกรรมทั่วไป 12 อย่าง เช่น การดูดฝุ่น การทำอาหาร การออกกำลังกาย การทำงานบนคอมพิวเตอร์ และกีฬา แต่ละตัวอย่างมีความยาว 20 วินาที ช่วยให้สามารถประเมินสถานการณ์ต่างๆ ได้อย่างสม่ำเสมอ

ข้อมูลเสียงและการเคลื่อนไหวได้รับการประมวลผลครั้งแรกโดยแบบจำลองขนาดเล็กที่สร้างคำอธิบายข้อความหรือการทำนายกิจกรรม จากนั้นจึงประเมินผลลัพธ์ข้อความเหล่านี้โดยแบบจำลอง LLM Gemini 2.5 Pro และ Qwen-32B Apple ได้ศึกษาประสิทธิภาพการทำงานในสองโหมด: โหมดที่มีรายการกิจกรรมที่กำหนดไว้ล่วงหน้า (ชุดปิด) และโหมดเปิดโดยไม่มีตัวเลือกใดๆ (ปลายเปิด) การศึกษาแสดงให้เห็นว่าแบบจำลองภาษาสามารถรวมเอาต์พุตจากเซ็นเซอร์ต่างๆ ได้อย่างมีประสิทธิภาพ และช่วยให้เข้าใจกิจกรรมต่างๆ ได้ดียิ่งขึ้น โดยเฉพาะอย่างยิ่งเมื่อข้อมูลดิบนั้นเอง nestอาชิ



วันนี้มีคนอ่านมากที่สุด

.