zomony

ทำไมรูปโต๊ะทำงานหนึ่งรูปควรให้สินค้า 12 ชิ้น ไม่ใช่แค่ 1 ชิ้น

ลองเอาเครื่องมือค้นหาด้วยภาพไปถามว่า "โคมไฟตัวนี้คืออะไร" คุณจะได้คำตอบ แต่ถ้าถามต่อเรื่องคีย์บอร์ดที่อยู่ข้างๆ คุณต้องเริ่มใหม่ทั้งหมด -- ครอปรูป อัปโหลดใหม่ ถามใหม่ รูปโต๊ะทำงานไม่มี "สิ่งเดียว" ให้โฟกัส มันมีคีย์บอร์ด เมาส์ จอมอนิเตอร์ โคมไฟ แผ่นรองเมาส์ อาจมีต้นไม้เล็กๆ และขาตั้งโน้ตบุ๊กด้วย -- สินค้าที่แยกจากกันสิบชิ้นขึ้นไปอยู่ในเฟรมเดียว เครื่องมือส่วนใหญ่ถูกสร้างมาเพื่อตอบว่า "สิ่งเดียวในรูปนี้คืออะไร" ไม่ใช่ "มีอะไรทั้งหมดอยู่ในรูปนี้" ความแตกต่างนี้คือเหตุผลทั้งหมดที่เราเขียนโพสต์เรื่องโต๊ะทำงานอีกครั้ง

สมมติฐาน "สิ่งเดียว" ถูกฝังอยู่ในตัวระบบ ไม่ใช่แค่ข้อจำกัดเล็กๆ

นี่ไม่ใช่ช่องว่างเล็กๆ ในเครื่องมือที่คล้ายกัน -- มันคือคำถามคนละแบบตั้งแต่แรก โมเดลที่ถูกสร้างมาเพื่อ "ระบุวัตถุนี้" จะโน้มไปหาสิ่งที่เด่นที่สุดในเฟรมโดยธรรมชาติ -- สิ่งที่ใหญ่ที่สุด อยู่กลางที่สุด หรือเด่นที่สุดในภาพ นั่นคือพฤติกรรมที่ถูกต้องสำหรับรูปสินค้าชิ้นเดียว แต่เป็นพฤติกรรมที่ผิดสำหรับโต๊ะ ห้อง หรือชุดเสื้อผ้า ที่การโฟกัสแค่ "สิ่งเดียวที่เด่นที่สุด" จะทิ้งทุกอย่างที่เหลือในรูปไปเปล่าๆ

ระบบ AI มองภาพของ Zomony ถามคำถามคนละแบบตั้งแต่ต้น ไม่ใช่ "นี่คืออะไร" แต่เป็น "มีสินค้าที่แยกจากกันและซื้อได้กี่ชิ้นในรูปนี้ และแต่ละชิ้นอยู่ตรงไหน" คำสั่งที่ส่งไปยังโมเดล (Claude ผ่าน Amazon Bedrock) ขอให้หาสินค้าทุกชิ้นที่เจอได้อย่างชัดเจน แต่ละชิ้นมีกรอบตำแหน่งของตัวเอง ไม่ใช่ป้ายชื่อเดียวที่เดาดีที่สุดสำหรับทั้งภาพ ดูรายละเอียดเพิ่มเติมได้ที่วิธีที่ Zomony ค้นหาสินค้าทุกชิ้นในรูปภาพ

หน้าตาจริงบนโต๊ะทำงาน

อัปโหลดรูปโต๊ะทำงานจริงหนึ่งรูป คุณจะไม่ได้แค่ "โต๊ะทำงาน" แต่จะได้คีย์บอร์ด จอมอนิเตอร์ โคมไฟตั้งโต๊ะ แผ่นรองเมาส์ และอะไรก็ตามที่อยู่ในรูปจริงๆ -- แต่ละชิ้นมีกรอบ ป้ายชื่อ และหมายเลขบนรูปภาพ พร้อมลิงก์ค้นหาจริงของตัวเอง อัปโหลดครั้งเดียว รอครั้งเดียว ได้ทั้งโต๊ะ ไม่ต้องค้นหาทีละชิ้น

นี่คือสิ่งที่สำคัญที่สุดสำหรับวิธีที่คนเจอโต๊ะทำงานจริงๆ -- ไม่ใช่การยืนอยู่หน้าโต๊ะตัวเองแล้วมีคำถามเฉพาะเจาะจงข้อเดียว แต่เป็นการเลื่อนดูคลิป "desk tour" หรือรูปโต๊ะของเพื่อนร่วมงาน แล้วอยากรู้เรื่องหลายๆ อย่างในรูปเดียวกัน -- ทั้งโคมไฟ และ ขาตั้งจอ และ อะไรก็ไม่รู้ที่วางอยู่ตรงนั้น การต้องค้นหาทีละชิ้นซ้ำไปเรื่อยๆ ในรูปเดียว คือความยุ่งยากที่ทำให้คนถอดใจและไม่ซื้ออะไรเลยในที่สุด

ทำไมนี่คือการออกแบบ ไม่ใช่แค่ฟีเจอร์เสริม

พูดง่ายๆ ก็อาจบอกว่า "Zomony หาสินค้าได้หลายชิ้น" เหมือนเป็นฟีเจอร์เสริมที่เพิ่มเข้ามาจากการระบุสินค้าชิ้นเดียว แต่จริงๆ แล้วไม่ใช่ -- มันคือคำถามตั้งต้นที่ต่างกันโดยสิ้นเชิง และมันส่งผลต่อทุกขั้นตอนถัดไป: วิธีเขียนคำสั่งให้โมเดล วิธีให้คะแนนความมั่นใจเมื่อวัตถุซ้อนกันหรืออยู่ใกล้กันมาก และจำนวนผลลัพธ์ที่ "มากเกินไป" จนกรอบบนรูปภาพอ่านไม่ออก (Zomony จำกัดไว้ที่ 10-15 รายการที่มั่นใจที่สุดต่อรูป ซึ่งปรับมาเฉพาะสำหรับภาพที่มีของแน่นๆ อย่างโต๊ะทำงาน) สิ่งเหล่านี้จะไม่มีเลยถ้าคำถามตั้งต้นยังเป็น "สิ่งเดียวในรูปนี้คืออะไร"

สิ่งที่ยังมีข้อจำกัดตามความเป็นจริง

สินค้าที่ตรวจพบแต่ละชิ้นจะได้ลิงก์ค้นหาจริงไปยัง Shopee หรือ Lazada -- ไม่ใช่รายการที่สร้างขึ้นมา แต่ข้อมูลสินค้า (ชื่อ ราคา รูปภาพ) ที่อยู่หลังลิงก์นั้นยังเป็นข้อมูลจำลองอยู่ ในขณะที่การค้นหาแคตตาล็อกจริงของแต่ละมาร์เก็ตเพลสยังอยู่ระหว่างพัฒนา ดูภาพรวมทั้งหมดของสิ่งที่เป็นจริงกับสิ่งที่ยังไม่เสร็จได้ที่วิธีที่ Zomony ค้นหาสินค้าทุกชิ้นในรูปภาพ เราอยากพูดตรงๆ แบบนี้มากกว่าจะให้ความรู้สึกว่ามีมากกว่าที่สร้างจริงในตอนนี้

ลองกับโต๊ะที่มีของเยอะๆ

ยิ่งโต๊ะรกเท่าไหร่ ความแตกต่างนี้จะยิ่งเห็นชัดขึ้น -- รูปสินค้าเดี่ยวๆ ที่เรียบร้อยจะไม่ค่อยเห็นความต่างนี้ ถ้าคุณมีภาพหน้าจอ "desk tour" หรือโต๊ะทำงานของตัวเองที่รกจริงๆ อยู่ในคลังรูป นี่คือวิธีที่เร็วที่สุดในการลองดู: อัปโหลดรูป แล้วลองนับดูว่าได้สินค้าแยกกันกี่ชิ้น ระบบตรวจจับแบบเดียวกันนี้ใช้ได้กับรูปภาพทุกประเภท ไม่ใช่แค่โต๊ะทำงาน และลองใช้ได้ฟรี