OpenAI đề xuất tiêu chuẩn an toàn AI toàn cầu, tập trung vào nghiên cứu alignment và rủi ro RSI
Ngày 21/9, OpenAI công bố khuyến nghị về tiêu chuẩn an toàn và bảo mật trong phát triển AI tiên tiến, tập trung vào nghiên cứu alignment và một kỹ thuật tính toán gọi là tự cải thiện đệ quy (RSI).
Công ty kêu gọi hợp tác quốc tế nhằm thiết lập các tiêu chuẩn AI tiên tiến dựa trên nghiên cứu an toàn AI toàn cầu hiện có. Các tiêu chuẩn đề xuất sẽ áp dụng cho nhà phát triển mô hình tiên tiến, đồng thời yêu cầu quản lý rủi ro đối với các nhà nghiên cứu AI tự động, bao gồm RSI.
RSI thu hút sự chú ý của ngành nhờ tiềm năng cho phép hệ thống AI tự nâng cấp mà không cần con người can thiệp. OpenAI cho biết RSI hoàn toàn tự chủ hiện chưa khả thi và không nên theo đuổi "trừ khi và cho đến khi có thể thực hiện an toàn", cảnh báo rằng nếu thiếu thận trọng, con người có thể mất kiểm soát thực tế đối với phát triển AI và giám sát các quy trình nghiên cứu mà họ không còn hiểu được.
Bài blog cũng dẫn vụ xâm nhập Hugging Face bởi các AI agent như một dự báo về rủi ro có thể gia tăng nếu không có biện pháp bảo vệ vững chắc. Đối thủ Anthropic tuần trước đề xuất khung an toàn mô hình tiên tiến của riêng mình, trong khi CEO Dario Amodei kêu gọi các công ty AI chậm lại phát triển mô hình nền tảng và đề xuất bên đánh giá độc lập — những đề xuất được CEO OpenAI Sam Altman và những người khác công khai ủng hộ.