Model nhỏ được tối ưu tốt hơn đang đưa một phần inference về máy cá nhân, giảm độ trễ và hạn chế dữ liệu phải gửi lên cloud.