Chất lượng dữ liệu AI quan trọng hơn khối lượng dữ liệu. Có một giả định phổ biến về AI: cho nó thêm dữ liệu, nó sẽ trở nên tốt hơn. Điều này nghe có vẻ hợp lý. Nhưng thực tế thì không hẳn như vậy.
Nhiều hơn không đồng nghĩa với tốt hơn
Hãy nghĩ về nó như việc học hỏi từ những ghi chép. Một ngàn trang ghi chép lộn xộn sẽ không dạy bạn nhiều như năm mươi trang ghi chép rõ ràng, chính xác. Trí tuệ nhân tạo cũng học theo cách tương tự. Đưa một mô hình dữ liệu một đống thông tin không nhất quán và chưa được gắn nhãn rõ ràng, và nó sẽ không trở nên thông minh hơn. Nó sẽ bị lẫn lộn. Nó sẽ bắt đầu thu thập những thông tin không liên quan thay vì những mẫu hình thực sự.
Đây là một trong những bài học lớn nhất mà ngành AI vừa học được gần đây. Một mô hình tuyệt vời được cung cấp dữ liệu sai vẫn cho kết quả xấu. Một mô hình đơn giản được cung cấp dữ liệu xuất sắc có thể vượt trội hơn nó.
Tại sao điều này lại quan trọng hơn nữa trong y học
Trong hầu hết các ngành công nghiệp, việc dự đoán sai về AI chỉ là phiền phức. Trong các ứng dụng y tế và thẩm mỹ, rủi ro lại khác biệt. Một công cụ mô phỏng không chỉ cần trông có vẻ thuyết phục mà còn phải chính xác trong bối cảnh thực tế của các bệnh nhân, các quy trình thực tế và kết quả thực tế.
Tính đáng tin cậy đó không đến từ quy mô. Nó đến từ những trường hợp thực tế, được ghi chép rõ ràng: những bức ảnh nhất quán, chi tiết thủ tục chính xác, so sánh trước và sau thực tế trung thực. Đây là loại dữ liệu giúp hệ thống hiểu được kết quả thực tế là như thế nào, chứ không chỉ là một kết quả hoàn hảo, lý tưởng.
Các đội thường phải học hỏi từ những kinh nghiệm đau thương này. Dữ liệu không nhất quán không chỉ làm giảm độ chính xác mà còn gây ra sự mất lòng tin vào công cụ, vào kết quả và cuối cùng là vào việc sử dụng AI. Một báo cáo gần đây của ngành đã nói rõ điều này:
“Dữ liệu đáng tin cậy và được quản lý tốt vẫn là nền tảng cho mọi đổi mới tiếp theo.”
Những trường hợp thực tế rất khó tìm thấy. Đó chính xác là điểm mấu chốt.
Dữ liệu được quản lý tốt và chất lượng cao đang trở thành một tài sản thực sự, không chỉ là một chi tiết kỹ thuật. Việc thu thập dữ liệu đòi hỏi sự tin tưởng, sự nhất quán và sự hợp tác. Chính vì vậy, nó mới có giá trị. Nó không thể được thu thập hoặc tạo ra với quy mô lớn.
Hãy xem hai công cụ mô phỏng AI. Công cụ thứ nhất được đào tạo chủ yếu từ các hình ảnh kho ảnh và các ví dụ lý tưởng: ánh sáng rõ ràng, góc quay hoàn hảo, kết quả trong trường hợp tốt nhất. Công cụ thứ hai được đào tạo từ các trường hợp lâm sàng thực tế: ánh sáng trong cuộc sống hàng ngày, các kiểu cơ thể đa dạng, thời gian lành bệnh thực tế, những góc quay đôi khi không hoàn hảo.
Công cụ đầu tiên có thể trông ấn tượng hơn trong một bản demo được hoàn thiện kỹ lưỡng. Còn công cụ thứ hai có nhiều khả năng đưa ra được dự đoán chính xác hơn khi được sử dụng trên một bệnh nhân thực sự, trong một phòng khám thực sự, trong điều kiện thực tế. Khoảng cách giữa việc trông đẹp mắt trong bản demo và việc thực hiện công việc trong cuộc sống thực luôn luôn liên quan đến dữ liệu, chứ không phải là mô hình.
Toàn ngành đang chuyển hướng theo hướng này.
Việc chuyển đổi này vượt xa lĩnh vực y học thẩm mỹ. Trên nhiều lĩnh vực, các nhóm đã dành nhiều năm để cố gắng khai thác tối đa hiệu suất từ các mô hình của mình. Hiện tại, nhiều người đang nhận ra rằng cơ hội lớn hơn đã luôn nằm trong dữ liệu của họ. Các cơ quan quản lý cũng đang chú ý nhiều hơn. Họ ngày càng đặt câu hỏi không chỉ là “AI có hoạt động tốt hay không?” mà còn là “các bạn có thể cho chúng tôi biết dữ liệu này đến từ đâu và liệu nó đã được xử lý đúng quy trình hay chưa?”.”
Trong y học thẩm mỹ, các bệnh nhân thực sự tin tưởng vào các bác sĩ thực sự khi sử dụng dữ liệu của họ. Điều đó khiến câu hỏi trở nên quan trọng hơn bao giờ hết. Một công cụ AI chỉ đáng tin cậy như quá trình tạo ra dữ liệu mà nó đã học được, bao gồm việc ai đã cấp phép và mức độ nghiêm ngặt của việc tuân thủ giấy phép đó.
Đây là ý tưởng đằng sau một dự án mới mà chúng tôi đang xây dựng.
Đó cũng là lý do chính để chúng tôi triển khai một chương trình mới tại Arbrea: Chương trình Đối tác Nghiên cứu Arbrea. Thay vì theo đuổi việc thu thập thêm dữ liệu, chúng tôi đang xây dựng các mối quan hệ hợp tác trực tiếp với các bác sĩ và phòng khám đã có thể ghi chép đầy đủ về những trường hợp thực tế. Việc đồng ý vẫn ở đúng vị trí của nó: đó là giữa bác sĩ và bệnh nhân, như một phần của quy trình làm việc thông thường. Arbrea chỉ làm việc với các trường hợp được ẩn danh. Mục tiêu không phải là một bộ dữ liệu lớn hơn. Mà là một bộ dữ liệu tốt hơn, từ những trường hợp thực tế, giúp cho các mô phỏng của chúng tôi trở nên chính xác hơn cho tất cả mọi người.






