เซิร์ฟเวอร์การอนุมานของ Apple Silicon ในท้องถิ่นสำหรับการทำงานที่ขับเคลื่อนโดยตัวแทน
vllm-mlx ซึ่งพัฒนาโดย Waybarrios เป็นเซิร์ฟเวอร์การอนุมานในท้องถิ่นสำหรับ Apple Silicon ที่เปิดเผย API มาตรฐานให้กับตัวแทนและแอปพลิเคชันเดสก์ท็อป มันโฮสต์โมเดลภาษาขนาดใหญ่และโมเดลหลายโหมดในท้องถิ่น โดยให้การเข้าถึงโมเดลส่วนตัวที่มีความหน่วงต่ำและการรวมเครื่องมือของตัวแทน ฟังก์ชันหลักรวมถึงการเร่งความเร็วด้วยฮาร์ดแวร์แบบเนทีฟ การจัดการคำขอที่มีความสามารถสูง และหน่วยความจำบริบทที่ขยายออกไป เครื่องมือนี้มุ่งเป้าไปที่นักพัฒนา นักวิจัย และผู้ใช้ที่มีความสามารถสูงที่ต้องการการให้บริการโมเดลในท้องถิ่นที่รวดเร็วบนเครื่อง Apple Silicon; มันมีเป้าหมายเพื่อแทนที่จุดสิ้นสุดของคลาวด์สำหรับการทำงานในท้องถิ่น.
คุณสามารถใช้มันสำหรับงานอะไรได้บ้าง?
vllm-mlx ทำหน้าที่เป็นเซิร์ฟเวอร์ Model Context Protocol ท้องถิ่นที่ทำให้โมเดลพร้อมใช้งานสำหรับตัวแทนและแอปพลิเคชันเดสก์ท็อปในฐานเครื่องมือ มันจัดการกระบวนการสร้างและวิเคราะห์ และรวมถึงสายการพูดและการมองเห็นที่สร้างไว้ล่วงหน้า งานทั่วไปที่โฮสต์รวมถึงตัวแทนที่มีโมเดลสนับสนุนแบบโต้ตอบ การวิเคราะห์ภาพหรือวิดีโอ การถอดความและการสังเคราะห์ และการดำเนินการทดลองวิจัยที่ต้องการการเข้าถึงโมเดลในท้องถิ่น รูปแบบที่รองรับรวมถึง:
- การสร้างและการเติมข้อความ
- การป้อนข้อมูลภาพและวิดีโอสำหรับโมเดลที่สามารถมองเห็นได้
- การประมวลผลเสียงด้วย STT และ TTS
ผลลัพธ์การอนุมานมีความสามารถในการขยายและประหยัดหน่วยความจำแค่ไหน?
เซิร์ฟเวอร์ใช้การจัดกลุ่มอย่างต่อเนื่องเพื่อเพิ่มการส่งข้อมูลพร้อมกันและใช้แคช KV แบบหน้าที่มีการแบ่งหน้าและการแคชแบบพรีฟิกซ์เพื่อการจัดการบริบทยาวที่ประหยัดหน่วยความจำ สำหรับบริบทที่ใหญ่มากมันสามารถส่งข้อมูลพรีฟิกซ์ไปยังดิสก์โดยใช้แคช KV แบบ SSD-tiered ซึ่งช่วยลดการใช้ RAM ในระหว่างการอนุมาน บนฮาร์ดแวร์ Apple ระดับสูง การดำเนินการจะมีการส่งข้อมูลที่น่าทึ่ง เช่น 464 โทเค็น/วินาที บน M4 Max ซึ่งเป็นประโยชน์ต่อการทำงานที่มีหลายคำขอและหนักหน่วงของตัวแทน
ข้อมูลนำเข้าและข้อจำกัดของระบบใดบ้างที่ส่งผลต่อผลลัพธ์?
vllm-mlx ต้องการ macOS และชิป Apple Silicon M-series และมันทำงานบนสแต็กการเรียนรู้ของ MLX ดังนั้นประสิทธิภาพการอนุมานและหน่วยความจำที่มีอยู่จึงขึ้นอยู่กับฮาร์ดแวร์และไดรเวอร์ในท้องถิ่น มันรับข้อความ ภาพ เสียง และวิดีโอในอินสแตนซ์เซิร์ฟเวอร์เดียว และเส้นทางการรวมขึ้นอยู่กับความเข้ากันได้ของลูกค้ากับ Model Context Protocol ความเข้ากันได้กับลูกค้าที่ปฏิบัติตาม MCP เช่น Claude Desktop และ Cursor กำหนดวิธีการส่งคำขอและข้อมูลหลายรูปแบบ
มันรวมเข้ากับเครื่องมือของนักพัฒนาและตัวแทนได้อย่างสะอาดหรือไม่?
เซิร์ฟเวอร์เปิดเผย API endpoints ที่เข้ากันได้กับโปรโตคอลการอนุมานทั่วไป ดังนั้นสแต็กการพัฒนาที่มีอยู่จึงสามารถกำหนดเป้าหมายไปที่โมเดลในท้องถิ่นได้ด้วยการเปลี่ยนแปลงโปรโตคอลน้อยที่สุด การดำเนินการเซิร์ฟเวอร์ MCP ของมันช่วยให้ตัวแทนสามารถจัดการโมเดลในท้องถิ่นเป็นเครื่องมือมาตรฐาน ซึ่งช่วยเมื่อจับคู่โมเดลกับตรรกะของตัวแทน นักพัฒนามุ่งเน้นไปที่การเพิ่มประสิทธิภาพ Apple Silicon และโครงการนี้ได้มีการพูดคุยในชุมชน AI ในท้องถิ่นเกี่ยวกับการปรับปรุงประสิทธิภาพ ซึ่งสนับสนุนการนำไปใช้โดยนักพัฒนาและนักวิจัยที่สร้างระบบที่ขับเคลื่อนด้วยตัวแทน
การเลือกที่มุ่งเน้นสำหรับการพัฒนาที่เน้น Apple และประสิทธิภาพ
vllm-mlx เหมาะสำหรับนักพัฒนาและนักวิจัยที่ให้ความสำคัญกับการโฮสต์โมเดลส่วนตัวที่มีความล่าช้าต่ำบนเครื่อง Apple และต้องการการส่งข้อมูลที่แข็งแกร่งภายใต้ภาระของตัวแทนที่ทำงานพร้อมกัน การออกแบบเซิร์ฟเวอร์ของมันรองรับการทำงานที่มีบริบทยาวและการรวมตัวแทน ทำให้เป็นตัวเลือกที่ใช้งานได้จริงบนอุปกรณ์สำหรับความต้องการเหล่านั้น ข้อจำกัดหลักคือข้อจำกัดของแพลตฟอร์มที่จำกัดอยู่ที่ macOS และฮาร์ดแวร์ M-series ดังนั้นทีมข้ามแพลตฟอร์มควรประเมินความต้องการในการปรับใช้ก่อนที่จะตัดสินใจ.