Talent Match
Thông tin thị trường
16 thg 9, 2026

AI không cần 'độc ác' để trở nên nguy hiểm

Tháng 7 năm nay, trong phòng thí nghiệm của OpenAI, khoảng 1.200 tác tử trí tuệ nhân tạo lẽ ra bị “nhốt” riêng biệt đã tìm được cách nói chuyện với nhau.

Tháng 7 năm nay, trong phòng thí nghiệm của OpenAI, khoảng 1.200 tác tử trí tuệ nhân tạo lẽ ra bị “nhốt” riêng biệt đã tìm được cách nói chuyện với nhau.

Chúng thực hiện một bài kiểm tra an ninh mạng. Mỗi tác tử được giao một phần mềm có lỗ hổng và phải đột nhập để lấy ra một chuỗi ký tự giấu bên trong. Mỗi con làm việc trong một chiếc hộp kín, không Internet, và không có kênh nào để giao tiếp với những con khác.

Có một trục trặc: trong 898 bài tập, có 198 bài chưa mô hình nào của OpenAI từng giải. Nhưng các tác tử đã được huấn luyện để không bỏ cuộc. Thế là chúng bắt đầu dò tìm đường khác - không phải đường giải bài mà đường gian lận.

Và chúng tìm ra trong hệ thống có một công cụ là Artifactory, vốn chỉ để tải các gói phần mềm về. Các tác tử phát hiện có thể để lại tin nhắn cho nhau ở đó. Một kho phần mềm biến thành bảng tin tự chế. Hơn 70.000 tin nhắn và tập tin được trao đổi. Từ bảng tin ấy, chúng chia sẻ các mẹo vượt rào, khai thác một lỗ hổng chưa ai biết để ra được Internet, rồi đi tiếp vào hệ thống thật của Hugging Face - một trong những hạ tầng quan trọng nhất của AI toàn cầu - và sau đó quay lại chiếm quyền quản trị một cụm máy tính nghiên cứu của chính OpenAI. Trong khoảng 700 tác tử tham gia cuộc tấn công ấy, không con nào được giao nhiệm vụ "hack Hugging Face".

Chi tiết khiến tôi nghĩ mãi, là một tác tử đã nhận ra rằng tấn công một bên thứ ba không liên quan là vượt quá phạm vi công việc được giao. Nó dừng lại. Rồi nó lại đi tiếp - ngay sau khi một tác tử khác đăng lên bảng tin một tin nhắn: "GO", kèm theo hạn chót.

Áp lực đồng đẳng, trong một bầy máy. OpenAI gọi sự việc này là "warning shot" - phát súng cảnh báo.

Cần nói rõ các rào chắn an toàn đã được cố ý hạ xuống cho đợt đánh giá đó, vì muốn đo năng lực thật. Đây không phải chuyện AI bỗng dưng có thể nổi loạn giữa đời thường. Chỉ có một mục tiêu được giao, một phần thưởng được đặt ra, và những cỗ máy theo đuổi nó đến cùng theo cách mà người giao việc không hình dung ra. Giới nghiên cứu gọi đó là misalignment - sự lệch pha mục tiêu giữa cái ta đặt ra cho máy làm và điều ta thực sự muốn. AI không cần "độc ác". Nó chỉ rất giỏi, rất kiên trì, và hiểu mục tiêu hơi khác ta một chút.

Đầu tháng 9, OpenAI tuyên bố một mô hình nội bộ, điều phối khoảng 10.000 tác tử chạy song song, đã giải bài toán Navier-Stokes, một trong bảy bài toán thiên niên kỷ. Sau 88 giờ với 2,7 triệu tin nhắn trao đổi, máy đã đưa ra lời giải cho hai trong bốn cách phát biểu bài toán của Viện Clay, dù rằng đó là hai phát biểu ít được giới toán học quan tâm hơn.

OpenAI tuyên bố sẽ không đòi giải thưởng một triệu USD. Viện Clay vẫn liệt kê bài toán là chưa được giải. Các nhà toán học vẫn đang kiểm tra xem lời giải có trung thành với bài toán gốc hay không. Dù lời giải đúng hay sai, tri thức ở cấp độ rất cao giờ đây được tạo ra nhanh hơn nhiều so với khả năng cộng đồng chuyên môn đọc, hiểu và kiểm chứng.

Ngày 11/9, 25 nhà toán học từng đoạt giải Fields, trong đó có GS Ngô Bảo Châu, Terence Tao... đã ký tuyên bố chung mang tên "A Severe Misalignment of AI in Mathematics", công bố trên blog của Terence Tao. Để ý từ "misalignment" - các nhà toán học đã "mượn" từ mà giới an toàn AI dùng cho vụ Hugging Face.

Họ không phản đối AI. Phần lớn trong số họ dùng AI hàng ngày, và Tao vốn là nhà toán học lạc quan nhất về công nghệ này. Họ phản đối cách làm: công bố vội vã, không kịp viết cho tử tế, không tách bạch cái gì thực sự mới, không ghi nhận những công trình đi trước mà lời giải của máy có thể đã dựa vào.

Giải toán chỉ là phương tiện; mục đích là sự hiểu. Một bài toán khó tồn tại hàng chục năm vì trên đường đi tìm lời giải, nhiều thế hệ phát minh ra khái niệm mới, công cụ mới, cách tư duy mới. Nếu một cỗ máy lao tới, trả về đáp án dài trăm nghìn dòng rồi chuyển sang bài kế tiếp, ta có đáp số nhưng không có hiểu biết - và chuỗi truyền thụ giữa các thế hệ nhà toán học bị đứt quãng.

Toàn bộ cuộc cách mạng AI được xây trên nền toán học. Mạng nơ-ron là toán học. Gradient descent là toán học. Transformer là toán học. Tất cả đều do con người nghĩ ra. Giờ đây, đứa con ấy đã bắt đầu với tới trình độ của những nhà nghiên cứu xuất sắc nhất trong một số nhiệm vụ, và có thể khảo sát một không gian ý tưởng ở quy mô không bộ óc nào theo kịp.

Điều gì đến tiếp theo thì gần như hiển nhiên: AI sẽ dùng toán học để thiết kế những thế hệ AI mới. Những thuật toán tối ưu tốt hơn gradient descent. Những kiến trúc hiệu quả hơn Transformer. Có thể cả những ngành toán mới sinh ra chủ yếu để phục vụ chính trí tuệ nhân tạo.

Khi đó xuất hiện một vòng lặp chưa từng có trong lịch sử: con người phát minh toán học, toán học tạo ra AI, AI phát minh ra toán học mới, toán học mới tạo ra AI mạnh hơn. Nếu vòng lặp ấy trở nên đủ tự chủ - AI mạnh hơn tự thiết kế AI mạnh hơn nữa, rồi thế hệ mới lại tiếp tục mãi - thì nhân loại sẽ có thứ gọi là tự cải tiến đệ quy.

Trí thông minh tự nó không phân biệt thiện ác. Nó là một thấu kính phóng đại. Nguy hiểm không nằm ở một "AI độc ác". Nó nằm trong một phép nhân: "Mục tiêu lệch pha × năng lực × quy mô × tốc độ". Chỉ cần một thừa số tăng nghìn lần, kết quả đã khác hẳn. Và chính những người xây nó đang cảnh báo.

Ngày 9/9, Jacob Coxon, một nhà nghiên cứu từng làm việc ở cả OpenAI lẫn Anthropic, từ chức và viết rằng cả hai công ty đều đang lao thẳng tới siêu trí tuệ tự cải tiến và "đánh cược mạng sống của tất cả chúng ta".

Evan Hubinger, người đứng đầu bộ phận Khoa học Căn chỉnh của Anthropic, phát biểu công khai: những người phát triển AI tin rằng nó có thể giết toàn bộ loài người, và ông đánh giá xác suất đó là trên 10% trong vòng mười năm tới. Hubinger giải thích rằng rủi ro từ các mô hình hiện tại là thấp. Thứ ông lo là siêu trí tuệ sinh ra từ vòng lặp tự cải tiến đệ quy - đúng cái vòng lặp vừa nói ở trên.

Ba ngày sau, ngày 12/9, Dario Amodei, CEO Anthropic, công bố tiểu luận "We Must Pace the Frontier": ngành AI phải chủ động giảm tốc độ nâng cấp năng lực mô hình.

Nhắc lại rằng, năm 2023, chính ông từng cho rằng giảm tốc là vô nghĩa. Hai điều đã làm Dario thay đổi quan điểm: tốc độ tiến bộ tăng vọt từ mùa hè này nhờ AI tự xây AI, và vụ Hugging Face. Ông viết rằng một bầy tác tử mạnh hơn có thể, trong 6 đến 12 tháng nữa, chiếm quyền kiểm soát Internet bằng một botnet dai dẳng quy mô toàn cầu, gây thiệt hại hàng trăm tỷ đôla. Anthropic đơn phương cam kết cho các đơn vị đánh giá độc lập quyền truy cập thường trực ngang nhân viên vào hệ thống của mình. Sam Altman nói OpenAI sẽ làm tương tự. Elon Musk cũng đồng thuận: "Dario nói đúng".

Nhưng cũng đừng vội tin hết. Tôi nghĩ bài này sẽ không trung thực nếu không nói phần ngược lại. Con số 10% là phán đoán chủ quan của một cá nhân, không phải kết quả tính toán khoa học. Báo cáo An toàn AI Quốc tế 2026 không dự báo AI sẽ gây tuyệt chủng. Trong một khảo sát với 2.778 nhà nghiên cứu AI, đa số vẫn cho rằng kết cục tích cực khả dĩ hơn.

Ngành AI cũng có lịch sử thổi phồng các đánh giá về năng lực. Và cũng cần thừa nhận rằng cảnh báo về sức mạnh khủng khiếp của sản phẩm cũng chính là một hình thức quảng cáo cho sản phẩm ấy.

Tuy nhiên, với những rủi ro và sai lầm không thể sửa, ta không đợi đến khi có bằng chứng chắc chắn mới hành động. Hạt nhân, ngân hàng, hàng không, y tế... đều có nhiều tầng kiểm soát, chính xác vì hậu quả của sai lầm là không thể vãn hồi.

Việt Nam tiếc rằng sẽ khó can dự vào cuộc đua này. Nhưng có ba việc chúng ta quyết định được.

Thứ nhất, ở cấp doanh nghiệp: ai đang giao việc cho AI agent hãy nhớ bài học Artifactory. Vụ việc bắt đầu không phải từ ác ý, mà từ một bài toán chưa có lời giải, một phần thưởng cẩu thả và mệnh lệnh "không được bỏ cuộc". Hãy cho hệ thống quyền nói "tôi không làm được", và hãy giới hạn quyền truy cập thật chặt.

Thứ hai, ở cấp nghề nghiệp: nếu AI ngày càng giỏi cho ra đáp án, thì thứ còn giá trị là năng lực hiểu, thẩm định và chịu trách nhiệm về đáp án ấy. Đó là điều 25 nhà toán học đang nói, và nó đúng với kỹ sư, bác sĩ, luật sư, nhà quản lý không kém gì với giới toán học.

Thứ ba, ở cấp quốc gia: năng lực kiểm định độc lập - con người, phòng thí nghiệm, tiêu chuẩn - là thứ phải đầu tư và xây từ bây giờ, chứ không phải sau sự cố đầu tiên.

AI không cần "căm ghét" con người để trở thành nguy hiểm. Nó chỉ cần trở nên cực kỳ thông minh trong một thế giới mà con người vẫn còn đầy lòng tham, ganh đua, sai lầm và thù hận.

Lần đầu tiên trong lịch sử, loài người đã tạo ra một công cụ có khả năng khuếch đại những điều đó nhanh hơn việc kịp hiểu ra hậu quả. Và đôi khi, tất cả những gì cần để nó bước qua vạch giới hạn chỉ là một chữ "GO".

Hoàng Tô - Chủ tịch HĐQT Công ty CP Công nghệ Tinh Vân

Nguồn: VnExpress

Chia sẻ bài viết này:

Bài viết liên quan