เปลี่ยนกล้องมือถือ
ให้เป็นดวงตา
แอปสำหรับผู้พิการทางสายตา ที่วิเคราะห์สภาพแวดล้อมรอบตัวด้วยปัญญาประดิษฐ์บนเครื่อง — บอกว่ามีอะไรอยู่ตรงไหน ห่างแค่ไหน และอ่านข้อความให้ฟัง ทั้งหมดนี้ทำงานได้แม้ไม่มีอินเทอร์เน็ตแม้แต่นิดเดียว
การเดินทางในที่ที่ไม่คุ้นเคย ไม่ควรต้องพึ่งสัญญาณเน็ต หรือแลกมาด้วยความเป็นส่วนตัว
สิ่งที่แอปทำได้ ในปุ่มเดียว
ออกแบบให้ควบคุมง่ายที่สุดสำหรับผู้ที่มองไม่เห็น — แตะหรือสั่งด้วยเสียง แล้วให้แอปเล่าสิ่งที่อยู่ตรงหน้าให้ฟัง
ตรวจจับวัตถุ & จัดลำดับความสำคัญ
ระบุคน สิ่งของ และสิ่งกีดขวางในเฟรม พร้อมเลือกบอกสิ่งที่สำคัญต่อความปลอดภัยก่อน
ประเมินระยะทาง
บอกว่าวัตถุอยู่ห่างกี่เมตร ใช้ LiDAR เมื่อมี และประเมินจากภาพเมื่อไม่มี โดยไม่เดาระยะทางแบบมั่ว
บรรยายฉากเป็นภาษาไทย
โมเดลภาษาบนเครื่องเรียบเรียงสิ่งที่เห็นเป็นประโยคธรรมชาติ และมีคำบรรยายสำรองเมื่อโมเดลไม่พร้อม
สั่งงานด้วยเสียง
ถอดเสียงพูดเป็นคำสั่งบนเครื่อง ถามได้ว่า “ข้างหน้ามีอะไร” หรือให้ช่วยหาสิ่งของที่ต้องการ
อ่านข้อความให้ฟัง
จับภาพป้าย เมนู หรือเอกสาร แล้วอ่านออกเสียง เมื่อมีข้อความหลายจุดจะให้เลือกว่าจะอ่านอันไหน
เตือนการชนด้วยการสั่น
สั่นเตือนอัตโนมัติเมื่อวัตถุเข้าใกล้เกินระยะที่ตั้งไว้ พร้อมสัญญาณเสียงบอกทิศทาง ปรับระยะเริ่มเตือนได้เอง
จากภาพหนึ่งเฟรม สู่เสียงบรรยาย ใน 6 ขั้นตอน
ทุกขั้นตอนเชื่อมกันแบบ pipeline ด้วยการฉีดพึ่งพา (dependency injection) ที่ทดสอบแยกส่วนได้ และไม่มีขั้นตอนใดต้องออกอินเทอร์เน็ต
รับภาพจากกล้อง
ดึงเฟรมและข้อมูลความลึกจากเฟรมเดียวกันผ่าน ARKit
ตรวจจับวัตถุ
หาว่ามีวัตถุอะไรบ้างและอยู่ตำแหน่งใดในภาพ
ประเมินความลึก
เลือกใช้ LiDAR หรือประเมินจากภาพแบบปรับตามสถานการณ์
หลอมรวมฉาก
รวมวัตถุ ระยะ และความน่าเชื่อถือเข้าเป็นภาพฉากเดียว
เรียบเรียงคำบรรยาย
ให้โมเดลภาษาเล่าเป็นประโยค หรือใช้คำบรรยายสำรอง
พูด · สั่น · เสียงเตือน
ส่งออกเป็นเสียงบรรยาย การสั่น และสัญญาณเสียงบอกทิศ
โมเดลระดับงานวิจัย ที่ถูกย่อให้รันในมือถือ
ทุกโมเดลถูกควอนไทซ์และแพ็กลงในแอปโดยตรง โหลดจากในเครื่อง ไม่มีการเรียก API ภายนอก
โมเดลตรวจจับวัตถุรุ่นเล็กที่สุดของ Ultralytics ส่งออกเป็น Core ML เพื่อความเร็วบน Neural Engine
ประเมินความลึกเชิงสัมพัทธ์จากภาพเดียว ใช้เป็นตัวสำรองเมื่ออุปกรณ์ไม่มีเซนเซอร์ LiDAR
ถอดเสียงพูดเป็นข้อความบนเครื่องผ่านบริดจ์ whisper.cpp ที่คอมไพล์เป็น native สำหรับ iPhone
โมเดลภาษา 2 พันล้านพารามิเตอร์ ควอนไทซ์ 4-bit เรียบเรียงสิ่งที่ตรวจพบเป็นคำบรรยายภาษาไทย
ข้อมูลของคุณ
ไม่เคยออกจากเครื่อง
แอปไม่มีเส้นทางเครือข่ายสำหรับส่งข้อมูลออกเลย ภาพ ความลึก เสียง และคำบรรยายทั้งหมดอยู่ในหน่วยความจำชั่วคราวของการวิเคราะห์นั้นเท่านั้น
สร้างแบบเนทีฟ ทดสอบได้ ตรวจสอบได้
สถาปัตยกรรมแบบฉีดพึ่งพาผ่านโปรโตคอล ทำให้แต่ละบริการถูกจำลองและทดสอบแยกส่วนได้จริง รองรับทั้งอุปกรณ์ที่มีและไม่มี LiDAR