ในโลกของ AI ที่เปลี่ยนแปลงอย่างรวดเร็วทุกสัปดาห์ การติดตามข่าวสารและนวัตกรรมล่าสุดกลายเป็นสิ่งจำเป็นอย่างยิ่งสำหรับนักพัฒนา นักวิจัย และผู้สนใจเทคโนโลยี โดยเฉพาะอย่างยิ่งเมื่อเครื่องมือใหม่ๆ ที่ powerful และ open-source ถูกเปิดตัวอย่างต่อเนื่อง บทความนี้จะพาคุณสำรวจเทคโนโลยี AI ที่น่าทึ่งในช่วงสัปดาห์ที่ผ่านมา ตั้งแต่ video generators ที่สามารถสร้างวิดีโอคุณภาพสูงจาก text prompt, image และ video references ไปจนถึง AI agents ที่มี memory อัจฉริยะ และ humanoid robots ที่แสดงความสามารถเกินมนุษย์
1. Open-Source Video Generators ที่ทรงพลัง
LTX2: ผู้นำใหม่ในวงการ video generation

LTX2 คือ open-source video generator ที่ไม่เพียงแค่สร้างวิดีโอความละเอียดสูงพร้อมเสียงในตัว แต่ยังสามารถสร้างวิดีโอความยาวถึง 20 วินาทีได้อย่างสม่ำเสมอ จุดเด่นคือ:
- ความเร็วสูง: รันได้แม้ใช้ consumer GPU
- รองรับ start และ end keyframes
- อัปโหลด audio track เพื่อใช้เป็นเสียงประกอบวิดีโอ
ตัวอย่างเช่น GGUFS รุ่น distilled Q4 มีขนาดเพียง 12.7GB และสามารถรันบน AMD หรือแม้แต่ CPU ได้อย่างมีประสิทธิภาพ
Uni-Video โดย Clling: Multimodal Generator ที่ครบเครื่อง

Uni-Video คือโมเดล unified multimodal ที่สามารถ:
- สร้างวิดีโอจาก text prompt + reference images/videos
- สลับตัวละคร แทนที่วัตถุในวิดีโอ
- สร้างฉากที่ซับซ้อน เช่น action sequences ด้วยคำสั่งเพียงบรรทัดเดียว
ตัวอย่างเช่น:
- นำภาพของ Sam Altman, Pikachu และไอศกรีม มาสร้างฉากใหม่ที่รวมทุกอย่างเข้าด้วยกัน
- เปลี่ยน Spider-Man ในวิดีโอให้กลายเป็น Superman ได้อย่างง่ายดาย
DreamStyle: AI เปลี่ยนสไตล์วิดีโอได้อย่างน่าทึ่ง

DreamStyle สามารถเปลี่ยนสไตล์วิดีโอให้เป็น:
- Origami, Lego, Pixel Art, Claymation
- ภาพประกอบสีไม้ หรือแม้กระทั่งภาพวาดจีนโบราณ
เปรียบเทียบกับ Luma, Pixverse และ Runway แล้ว DreamStyle ให้ผลลัพธ์ที่ตรงกับ prompt มากที่สุด
2. AI Agents และระบบ Memory อัจฉริยะ
SimpleM: ระบบ memory ใหม่สำหรับ AI Agents

SimpleM คือ memory framework ที่ชาญฉลาดกว่าเดิม ด้วย 3 ขั้นตอนสำคัญ:
- Semantic Compression: ย่อข้อมูลให้กระชับโดยไม่เสียความหมาย
- Structured Indexing: จัดเรียงข้อมูลให้ค้นหาได้ง่าย
- Adaptive Retrieval: ดึงเฉพาะข้อมูลที่จำเป็นเมื่อถูกถาม
ผลลัพธ์คือ:
- ใช้ tokens น้อยลง
- ความแม่นยำสูงขึ้น
- การค้นคืนข้อมูลเร็วขึ้นกว่า baseline approaches
Deeptutor: Open-source AI Tutor ที่สอนอย่างเชิงรุก

Deeptutor มีความสามารถที่เหนือกว่าการเป็น chatbot:
- วิเคราะห์เนื้อหาจาก textbooks, papers, lecture notes
- สร้างคำถาม, quizzes, แบบฝึกหัดที่ปรับตามความสามารถของผู้เรียน
- รองรับการวิจัยเชิงลึกและการอธิบายผ่าน diagrams หรือ interactive content
3. วิดีโอ 4D, การ morph แบบ 3D และ AI สร้าง model จากภาพถ่าย
Neoverse: สร้าง 4D World Models

Neoverse สามารถสร้าง video แบบ 3D โดยเพิ่มมิติของ “เวลา” เข้าไป:
- เปลี่ยนวิดีโอเป็นฉาก 3D ที่สามารถเคลื่อนกล้องได้อิสระ
- สร้าง bullet time effect
- รองรับ video editing เช่น เปลี่ยนสีวัตถุหรือเคลื่อนย้ายวัตถุในฉาก
MorphAny3D: การเปลี่ยนรูปร่าง 3D ระหว่างวัตถุที่แตกต่างกัน

MorphAny3D สามารถ morph วัตถุ 3D สองชิ้นที่ไม่เกี่ยวข้องกัน เช่น:
- Pokémon → Pokémon ตัวอื่น
- ม้า → เรือ
- สถานีรถไฟ → ปราสาท
ด้วยโครงสร้างที่ประกอบด้วย:
- Morphing Cross Attention
- Temporal Fusion
- Orientation Correction
Gamu: Geometry-Aware Multiview Diffusion Outpainting

Gamu สร้าง 3D model จากภาพถ่ายจำนวนจำกัด และสามารถ:
- เติมช่องว่างในฉาก 3D
- ขยาย field of view ได้อย่างสมจริง
- เปรียบเทียบกับ 3DGS หรือ MV Gen Master แล้ว Gamu แม่นยำและสมบูรณ์ยิ่งกว่า
4. Infinity Depth: การทำนายความลึกที่ระดับ 16K

Infinity Depth ไม่เพียงแค่สร้าง depth maps แม่นยำ แต่ยัง:
- รองรับความละเอียดสูงถึง 16K
- สร้าง 3D point cloud จากภาพเดียว
- ทำ novel view synthesis เพื่อให้ผู้ใช้ “เดิน” รอบฉากได้
เปรียบเทียบกับ Migold, Moji 2 หรือ Sharp (Apple) แล้ว Infinity Depth ให้ผลลัพธ์ที่คมชัดและสอดคล้องมากกว่า
5. Translation Model ที่เล็กแต่ทรงพลัง: HYMT โดย Tencent Hunyuan

HYMT เป็น open-source translation model ที่มีสองขนาด:
- 1.8B: เร็วและเบา เหมาะกับ edge devices
- 7B: คุณภาพสูงกว่าเล็กน้อย
จุดเด่น:
- เอาชนะ Gemini 3 Pro ในบาง benchmark
- รองรับ 33 ภาษา
- รันแบบ offline และ realtime ได้ด้วย RAM เพียง 1GB
6. Google เพิ่มฟีเจอร์ AI ให้ Gmail

Google กำลังเปิดตัวฟีเจอร์ใหม่ที่ใช้ AI ใน Gmail ได้แก่:
- สรุป inbox โดยอัตโนมัติ
- Help me write สำหรับเขียนอีเมลตาม prompt
- เพิ่มนัดในปฏิทินอัตโนมัติจาก context ของอีเมล
หมายเหตุ: ฟีเจอร์เหล่านี้เริ่ม rollout สำหรับผู้ใช้ในสหรัฐอเมริกาก่อน
7. Chat LLM โดย Abacus AI: แพลตฟอร์มรวม AI แบบ All-in-One

Chat LLM เป็นแพลตฟอร์มที่รวม:
- LLMs ชั้นนำ
- Image และ Video Generators
- Deep Agent สำหรับงานอัตโนมัติ เช่น สร้าง PowerPoints หรือ Websites
ราคา: เพียง $10 ต่อเดือน ซึ่งคุ้มค่ามากเมื่อเทียบกับการสมัครใช้แต่ละเครื่องมือแยกกัน
8. ความก้าวหน้าใน Humanoid Robots
Unitree H2: หุ่นยนต์ที่เตะได้แบบ Flying Kick

- สูง 180 cm หนัก 70 kg
- เตะถึงใบหน้าคน และ spin kick ทำลายแตงโมได้
- แข็งแรงเพียงพอที่จะเคลื่อนย้าย punching bags หนัก 60 kg
Boston Dynamics Atlas: หุ่นยนต์ที่มีความยืดหยุ่นสูง

- เคลื่อนไหวได้ 360° สำหรับศีรษะ ลำตัว แขนและขา
- ไม่จำกัดด้วยรูปแบบมนุษย์แบบเดิมๆ
- ออกแบบเพื่อการใช้งานที่มีประสิทธิภาพสูงสุด
สรุป: โลก AI กำลังก้าวไปข้างหน้าอย่างไม่หยุดยั้ง
สัปดาห์นี้แสดงให้เห็นถึงความก้าวหน้าที่น่าทึ่งของ AI ในหลายด้าน:
- ความสามารถในการสร้างวิดีโอและภาพที่สอดคล้องกับคำสั่ง
- AI agents ที่เข้าใจและจดจำข้อมูลได้ดีขึ้น
- หุ่นยนต์ที่แข็งแกร่งและยืดหยุ่นมากกว่ามนุษย์
- Translation models ที่แม่นยำและรันได้บนอุปกรณ์ธรรมดา
เครื่องมือและแพลตฟอร์มเหล่านี้ล้วนเปิดกว้าง (open-source) และพร้อมให้ผู้สนใจนำไปใช้งานหรือพัฒนาต่อ ดังนั้น หากคุณเป็นนักพัฒนา นักวิจัย หรือผู้สนใจ AI นี่คือเวลาที่ดีที่สุดในการเข้าร่วม wave แห่งนวัตกรรมนี้
💬 คุณชอบนวัตกรรม AI ตัวไหนมากที่สุดในสัปดาห์นี้? คอมเมนต์ด้านล่างและแชร์บทความนี้ให้กับผู้สนใจ AI คนอื่นๆ ด้วย!
ขอบคุณที่ติดตาม และเจอกันในบทความถัดไป!
📍 หากไม่อยากพลาดความรู้ดี ๆ แบบนี้ สามารถติดตาม Prompt Expert ตามช่องทางด้านล่างได้เลย
Website: prompt-expert.co
Facebook Page: Prompt-Expert





