
ข่าวนี้คืออะไร
OpenHands แพลตฟอร์ม agent โอเพนซอร์สที่รันได้ทั้ง local และ cloud ปล่อยเวอร์ชันเสถียร 1.15.0 เมื่อวันที่ 21 สิงหาคม
ประเด็นที่คนทำงานจริงควรสนใจไม่ใช่จำนวนฟีเจอร์ แต่เป็นการแก้ 3 จุดที่ชี้ไปที่ปัญหาเดียวกันคือ model integrity หรือความมั่นใจว่า model ที่คุณเลือกไว้คือ model ที่ agent ใช้รันจริง
3 จุดนั้นคือ
- กัน agent ถูก downgrade ไปใช้ profile ที่ต่ำกว่าโดยไม่แจ้งเตือน อาการนี้อันตรายเพราะงานยังรันได้ปกติ แค่คุณภาพเปลี่ยนโดยที่คุณไม่รู้
- ให้ model ที่คุณเลือกบนหน้าหลักมีผลจริง แทนที่จะโดนค่า pinned LLM ที่ฝังอยู่ใน agent profile เขียนทับเงียบ ๆ
- ห้ามระบบเซฟการเปลี่ยน model เข้า settings เมื่อหา profile ไม่เจอ เพราะค่าที่เซฟผิดจะติดไปกับ session ต่อ ๆ ไป
นอกจากนี้ฝั่ง automation ก็มีของใหม่คือ dashboard ที่เรียบร้อยขึ้น แนะนำ automation สำเร็จรูปให้ติดตั้ง และ catalog ที่แต่ละรายการมาพร้อม script bundle ที่รันได้เลย รวมถึงหน้าจัดการ provider connections สำหรับคนรัน local agent-server เอง
ทำไมทีมเล็กควรสนใจ
ตอนนี้หลายทีมเริ่มใช้ agent หลายตัว หลาย model ผสมกันในงานประจำวัน โจทย์จึงไม่ได้จบที่ model ตัวไหนเก่งกว่า แต่คือ มั่นใจได้ไหมว่างานแต่ละชิ้นรันด้วย model ที่คุณตั้งใจ
ปัญหา silent downgrade คือแบบที่แย่ที่สุดสำหรับทีมเล็ก เพราะไม่มี error ให้เห็น งานยังออกมา แต่คุณภาพต่างจากที่คาด แล้วเวลาทั้งหมดหลุดไปกับการหาสาเหตุในที่ผิด เช่นไปแก้ prompt ทั้งที่ตัวปัญหาคือ model ที่รันไม่ใช่ตัวที่คิด
ข่าวนี้เป็นการยืนยันจากแพลตฟอร์มใหญ่ว่าปัญหานี้เกิดจริงจนต้องออกแก้ถึง 3 จุดใน release เดียว และบทเรียนนี้ใช้ได้กับทุกเครื่องมือที่คุณใช้ ไม่ใช่แค่ OpenHands
วิธีเอาไปใช้จริง
- อัปเดตเป็น 1.15.0 ตามช่องทางที่ทีมติดตั้งไว้ ไม่ว่าจะเป็น pip docker หรือวิธีจาก docs.openhands.dev แล้วเช็กว่าได้เวอร์ชัน 1.15.0 จริง
- หลังอัปเดต เปิด conversation ใหม่แล้วดูตัวเลือก model บนหน้าจอว่าแสดง model ที่คุณตั้งไว้จริง อย่าเชื่อแค่ความจำว่าเมื่อวานตั้งอะไรไว้
- ตรวจ agent profile ที่มี pinned LLM ว่าไม่ชนะการเลือกบนหน้าจอ พฤติกรรมใหม่คือสิ่งที่คุณเลือกล่าสุดต้องมีผลก่อน ถ้าเจอพฤติกรรมสวนทางให้รายงานกลับเป็น bug
- ลอง automation จาก catalog หนึ่งตัว เริ่มจากงานที่พลาดได้ไม่เจ็บ เช่น สรุป PR รายสัปดาห์ แล้วเปิดดู run history ทุกวันแรกเพื่อดูว่าทำงานตรงเวลาและผลถูกจริง
- ทำ smoke task หลังทุกครั้งที่สลับ model หรือ profile ให้มีงานเล็กที่รู้คำตอบไว้เทียบ ถ้าผลเพี้ยนกว่าปกติให้ตรวจ model ที่รันก่อนแก้อย่างอื่น
Operator Kit
Checklist Model Integrity สำหรับทีมที่ใช้ agent หลาย model
ตรวจทุกวัน 2 นาที
- เปิดงานที่รันอยู่ ดูว่า model ปัจจุบันตรงกับที่ตั้งใจไว้หรือไม่
- ดู run history ของ automation ว่ามี run ไหน fail หรือข้ามไปโดยไม่มีเหตุผล
ตรวจทุกครั้งที่เปลี่ยน config
- สลับ model แล้วเปิด conversation ใหม่เพื่อยืนยันว่าค่าใหม่มีผลจริง
- แก้ profile แล้วรัน smoke task เทียบผลกับก่อนแก้
- อัปเดตเวอร์ชันเครื่องมือแล้วเช็ก 3 อย่างเดิมคือ model ที่รัน, permission ที่ใช้, และ output ที่คาดหวัง
สัญญาณที่บอกว่า model อาจไม่ใช่ตัวที่คิด
- คุณภาพงานเปลี่ยนไปโดยที่ prompt เดิมทุกอย่าง
- ความเร็วหรือ pattern การตอบเปลี่ยนไปจากที่คุ้นเคย
- ค่าใช้จ่าย token ขยับผิดปกติทั้งที่ปริมาณงานเท่าเดิม
กติกาป้องกัน
- มี smoke task ที่รู้คำตอบไว้ทดสอบทุกครั้งที่แตะ config
- จด model ที่ใช้ต่องานไว้ที่ไหนสักแห่งที่ทีมดูได้ ไม่เก็บไว้ในหัวคนเดียว
- ห้ามเชื่อว่าค่าเดิมยังอยู่เสมอ หลังอัปเดตเวอร์ชันต้องตรวจใหม่ทุกครั้ง
ข้อจำกัดที่ควรรู้
การแก้ทั้ง 3 จุดเป็นการแก้ในตัว OpenHands เอง ถ้าทีมใช้เครื่องมืออื่น ปัญหาแบบเดียวกันอาจยังอยู่ ควรใช้เช็กลิสต์ข้างบนตรวจบนเครื่องมือของคุณแทนการรอให้ vendor แก้
release นี้ไม่มีตัวเลข performance ใหม่ อย่าคาดหวังความเร็วที่แตกต่าง สิ่งที่ได้คือความมั่นใจว่าสิ่งที่รันคือสิ่งที่เลือก
สำหรับทีมที่รัน self-host การอัปเดตควรทำตอนที่มีคนดูแลอยู่ อย่าปล่อยอัปเดตแล้วเดินไปทำงานอื่นในวันที่มีงานสำคัญรันอยู่
เริ่มต้นวันนี้
ถ้าทีมคุณเริ่มมี agent หลายตัวและไม่แน่ใจว่าแต่ละงานรันด้วย model อะไรอยู่จริง Data-Espresso ช่วยตั้งระบบตรวจสอบ model integrity ให้เป็นขั้นตอนปกติของทีม ตั้งแต่ smoke task หลังสลับ model ไปจนถึงการรัน agent บน workspace ส่วนตัวผ่าน OPB Stack ที่ควบคุม model และสิทธิ์การเข้าถึงได้ชัดเจน
