เครื่องมือ Bridge สำหรับ AI เพื่อขับเคลื่อนเซสชัน Chrome จริงของคุณ
chrome-bridge, จาก Siropkin, เป็นเซิร์ฟเวอร์ MCP พร้อมส่วนขยาย Chrome ที่ออกแบบมาเพื่อให้เอเจนต์ AI สามารถเข้าถึงเซสชัน Chrome ที่ใช้งานอยู่ของผู้ใช้ได้อย่างควบคุมสำหรับงานที่ใช้เบราว์เซอร์ มันเปิดเผยรายการแท็บ, การดึงข้อมูล HTML/ข้อความแบบเต็มหน้า, การจับภาพหน้าจอ, และการทำงานอัตโนมัติแบบคลิกและพิมพ์ผ่าน WebSocket ท้องถิ่น ซึ่งช่วยให้การทำงานในหน้าและการแปลภาษาที่ขับเคลื่อนด้วย AI เป็นไปได้ เครื่องมือนี้มุ่งเป้าไปที่นักพัฒนาและผู้ใช้ที่มีความสามารถที่ต้องการการเข้าถึงเซสชันจริงที่ได้รับการตรวจสอบยืนยัน ในขณะที่ยังคงการประมวลผลทั้งหมดไว้ในเครื่องและไม่มีการเก็บข้อมูลการวัดผล.
คุณสามารถใช้มันทำงานอะไรได้บ้าง?
เครื่องมือนี้มีเป้าหมายที่การทำงานอัตโนมัติและการวิเคราะห์ที่เน้นเบราว์เซอร์ โดยเฉพาะการแปลข้อความด้วย AI และการทำงานที่คล้ายกัน มันสามารถแสดงแท็บที่เปิดอยู่และคืนค่า URL หรือชื่อแท็บที่ใช้งานอยู่ ดึงข้อความหรือ HTML ของหน้าเต็มสำหรับการวิเคราะห์ จับภาพหน้าจอที่มีความละเอียดสูง และทำการคลิกและพิมพ์เพื่อให้ตัวแทนสามารถโต้ตอบกับฟิลด์ฟอร์มหรือเรียกดูหน้า กรณีการใช้งาน รวมถึงการดึงข้อมูลที่แปลแล้ว การตรวจสอบหน้าที่มีการรับรอง และการตรวจสอบภาพ.
การจับภาพหน้าและการกระทำอัตโนมัติมีความเชื่อถือได้แค่ไหน?
chrome-bridge สร้างผลลัพธ์ที่เชื่อมโยงกับเบราว์เซอร์สด ซึ่งรักษาสถานะที่ล็อกอินและส่วนขยายไว้ ข้อเท็จจริงพื้นฐานนั้นหมายความว่าการดึง HTML และภาพหน้าจอสะท้อนถึงหน้าจริงตามที่ผู้ใช้เห็น ส่วนขยายมีการสนับสนุนการจับภาพหน้าจอและการดึงหน้าเต็มสำหรับการวิเคราะห์ AI ทางภาพและข้อความ และการคลิก/พิมพ์ที่ขับเคลื่อนด้วยเบราว์เซอร์ทำงานบน DOM ที่แท้จริง อย่างไรก็ตาม พฤติกรรมที่ซับซ้อนของลูกค้าบนแอปพลิเคชันหน้าเดียวที่ซับซ้อนอาจยังต้องการการตรวจสอบจากมนุษย์เกี่ยวกับการกระทำอัตโนมัติ.
มันรับข้อมูลอะไรบ้างและมีขีดจำกัดอย่างไร?
เครื่องมือนี้รับเซสชัน Chrome ที่ใช้งานอยู่เป็นพื้นผิวข้อมูลนำเข้าและให้ HTML ของหน้า ข้อความ และภาพกลับไปยังตัวแทน มันต้องการ Google Chrome v117+ และ Node.js v18+ และคาดหวังให้ลูกค้าที่พูดโปรโตคอล Model Context ดังนั้นความเข้ากันได้จึงขึ้นอยู่กับตัวแทนที่สามารถทำงานกับ MCP มันไม่ใช่การทดแทนแบบไม่มีหัวและไม่สร้างอินสแตนซ์เบราว์เซอร์ที่แยกออกมา ซึ่งจำกัดกรณีการใช้งานที่ต้องการสภาพแวดล้อมที่แยกออกมา.
การตั้งค่าทำได้ง่ายหรือไม่และความเป็นส่วนตัวจัดการอย่างไร?
การตั้งค่าใช้ Node CLI ที่ไม่มีการพึ่งพาและส่วนขยาย Chrome ที่เชื่อมต่อผ่าน WebSocket ท้องถิ่น ซึ่งเก็บการประมวลผลทั้งหมดไว้ในเครื่อง ส่วนขยายจะแสดงการซ้อนทับที่บอกเล่าเกี่ยวกับคำสั่งของตัวแทน โดยให้ข้อเสนอแนะแบบมองเห็นเกี่ยวกับการกระทำ นักพัฒนาระบุว่าไม่มีการเก็บข้อมูลและการดำเนินการเป็นท้องถิ่น ดังนั้นการควบคุมความเป็นส่วนตัวและการบรรยายที่มองเห็นได้ช่วยให้ผู้ใช้ติดตามและจำกัดสิ่งที่ตัวแทนสามารถทำได้.
เหมาะสำหรับนักพัฒนาที่ต้องการการเข้าถึงเบราว์เซอร์ที่ได้รับการตรวจสอบสิทธิ์โดยตรง
chrome-bridge เป็นตัวเลือกที่ใช้งานได้จริงสำหรับนักพัฒนาและผู้ใช้ที่มีความสามารถสูงซึ่งต้องการการโต้ตอบที่ขับเคลื่อนด้วย AI กับเซสชันเบราว์เซอร์ที่ได้รับการตรวจสอบสิทธิ์อยู่แล้วและให้ความสำคัญกับการประมวลผลในท้องถิ่น มันต้องการลูกค้าที่รองรับ MCP และรันไทม์ Chrome และ Node ที่ทันสมัย และผลลัพธ์อัตโนมัติควรได้รับการตรวจสอบด้วยตนเองเมื่อโต้ตอบกับหน้าเว็บที่มีพลศาสตร์หรือมีความละเอียดอ่อน ใช้มันเป็นเครื่องมือสำหรับนักพัฒนาเพื่อเสริม ไม่ใช่แทนที่ การตรวจสอบของมนุษย์ในกระบวนการทำงานบนเว็บ.