Một phép tính cho ra đáp số chưa chắc đã là một kết quả khoa học đáng tin. BootLoops 1.0, bộ công cụ mã nguồn mở do nhà vật lý Harvard Matthew Schwartz phát triển cùng Claude, được thiết kế để đưa các phép tính định lượng vào quy trình kiểm tra rõ ràng hơn. Công cụ này không gắn với riêng một mô hình AI nào; mục tiêu của nó là giúp kiểm tra những kết quả cụ thể, chứ không mặc định mọi câu trả lời của AI đều đúng.
11
2
BootLoops kiểm tra phép tính ra sao?
BootLoops kết hợp các phần mềm khoa học với những quy trình xác định thế nào mới được xem là một kết quả đã qua kiểm tra. Chẳng hạn, kết quả cần được đối chiếu bằng một phương pháp tính độc lập tại những điểm không được dùng để khớp mô hình. Quy trình còn yêu cầu một “đối chứng dương”: phép kiểm tra phải cho thấy nó có thể phát hiện kết quả sai. Hướng dẫn cũng lưu ý việc ghi nhận nguồn gốc dữ liệu và phương pháp, để công cụ đã góp phần tạo ra kết quả không tự đứng ra xác nhận chính kết quả ấy.
2
11
Cách làm này phù hợp với những bài toán có đầu ra xác định rõ, như một số phép tính trong vật lý toán. Nó có thể cung cấp bằng chứng rằng kết quả đã vượt qua những phép thử cụ thể; điều đó không chứng minh mọi nhận định do mô hình tạo ra đều đúng, cũng không cho biết câu hỏi nghiên cứu có đáng theo đuổi hay không.
2
5
Những kết quả được báo cáo cùng Claude
Nhóm của Schwartz cho biết đã tính 30 tích phân vật lý toán; trong đó, 15 kết quả được mô tả là mới, bao gồm các tích phân Feynman elliptic. Công trình cũng đưa ra lời giải cho điều Schwartz gọi là “bài toán cuối cùng” của Watson, gắn với chuỗi tính toán mà nhà toán học George Watson khởi xướng trước đó.
14
16
4
Trong nỗ lực rộng hơn, nhóm báo cáo đã tạo ra 36 bản thảo với 19 đồng tác giả thuộc 18 lĩnh vực, trong đó có sinh thái học và di truyền học quần thể. Đây là các bản thảo nghiên cứu được báo cáo, không đồng nghĩa mọi kết quả đã hoàn tất khâu kiểm chứng độc lập: Schwartz cho biết một số kết quả vẫn đang được thẩm tra.
3
15
4
Vì sao chuyên gia vẫn quan trọng?
Schwartz dùng cụm “lệch trở kháng” (impedance mismatch) để mô tả sự không ăn khớp giữa điều giới nghiên cứu cần và những việc các mô hình ngôn ngữ hiện nay làm tốt. AI có thể hữu ích với các nhiệm vụ tính toán có phạm vi rõ và có cách kiểm tra cụ thể. Nhưng nghiên cứu khoa học còn đòi hỏi phải chọn câu hỏi nào đáng đặt ra, rồi diễn giải xem câu trả lời có ý nghĩa gì.
1
5
Theo Schwartz, Claude tìm ra những mối liên hệ giữa các lĩnh vực; một số liên hệ có thể đúng về mặt kỹ thuật nhưng chưa chắc tạo ra đóng góp đáng kể cho ngành đó. Các chuyên gia trong từng lĩnh vực đã giúp định hướng công việc đến những câu hỏi thực sự quan trọng với họ. Nói cách khác, kiểm chứng tính toán giúp đánh giá một phép tính có vượt qua các phép thử hay không; còn phán đoán khoa học giúp quyết định nên tính điều gì và kết quả có ý nghĩa ra sao.
5
BootLoops chứng minh điều gì — và không chứng minh điều gì?
BootLoops đưa ra một cách tổ chức nghiên cứu có AI hỗ trợ xoay quanh những nhiệm vụ có thể kiểm tra, các phép đối chiếu độc lập và sự hướng dẫn của con người. Những kết quả được báo cáo cho thấy tiềm năng của cách tiếp cận này, nhưng không phải lời bảo đảm rằng mọi đáp án đều chính xác hay mọi kết quả đã được xác nhận độc lập. Một phép tính đã qua kiểm tra, tự nó, cũng chưa đủ cơ sở để đưa ra quyết định có hệ quả lớn: câu hỏi, giả định và tác động của quyết định vẫn cần được con người xem xét.
2
4
5