Trang chủ / Bài viết / Blog

Blog

Deepfake giọng nói là gì? Vì sao chỉ nghe giọng chưa đủ để tin

Chỉ vài giây âm thanh có thể bị dùng để tạo giọng nói giả. Tìm hiểu deepfake giọng nói hoạt động thế nào, vì sao khó nhận biết và quy trình xác minh để tự bảo vệ mình.

22/09/2026 · cậu bé mặt trăng

Bạn đang ở công ty thì nhận một cuộc gọi lạ. Đầu dây bên kia là giọng con mình, hoảng hốt xin chuyển tiền gấp vì “vừa gặp tai nạn”. Cách nói, nhịp thở, cả tiếng nấc nghe quen đến mức bạn không kịp nghi ngờ. Nhưng khi gọi lại vào số đã lưu, bạn mới biết con vẫn đang ngồi trong lớp.

Đó là một kịch bản lừa đảo bằng deepfake giọng nói. Nó đáng ngại không phải vì AI “ma thuật”, mà vì chúng ta vốn quen dùng giọng nói như một tín hiệu nhận dạng. Khi tín hiệu ấy có thể bị làm giả, cách an toàn nhất không còn là nghe kỹ hơn, mà là xác minh có quy trình.

Deepfake giọng nói là gì?

Nói đơn giản, đây là âm thanh do AI tạo ra để bắt chước giọng của một người có thật. Nếu con người muốn bắt chước ai đó thường phải nghe rất nhiều và luyện cách nhấn nhá, AI có thể học các đặc điểm của giọng như cao độ, nhịp, âm sắc và cách phát âm từ một mẫu ghi âm. Sau đó, hệ thống đọc một câu mới bằng chất giọng gần với người đó.

Mẫu âm thanh có thể đến từ video công khai, podcast, voice message, livestream hoặc một đoạn hội thoại bị ghi lại. Điều này không có nghĩa mọi đoạn ghi âm vài giây đều lập tức tạo ra một bản sao hoàn hảo; chất lượng còn phụ thuộc vào công cụ, dữ liệu đầu vào và điều kiện ghi âm. Tuy vậy, McAfee từng công bố thử nghiệm trong đó chỉ ba giây âm thanh đã tạo được bản sao đạt mức khớp 85% theo thang đánh giá của nhóm nghiên cứu của họ.

Điều cần nhớ: deepfake không cần khiến bạn tin 100%. Kẻ lừa đảo chỉ cần tạo đủ áp lực để bạn bỏ qua bước xác minh: “đừng cúp máy”, “chuyển ngay”, “đừng nói với ai”.

Cách thức hoạt động

Từ một đoạn ghi âm tới cuộc gọi giả mạo

Minh họa do Tekomi biên tập dựa trên cơ chế voice cloning và dữ liệu nghiên cứu của McAfee; không sử dụng ảnh AI tạo sinh.

1. Thu thập mẫu giọngVideo công khai, tin nhắn thoại hoặc cuộc gọi bị ghi lại.
2. AI phân tích đặc điểmÂm sắc, cao độ, nhịp nói và cách nhả chữ được mô hình hóa.
3. Tạo giọng tổng hợpHệ thống đọc một câu hoàn toàn mới bằng giọng gần giống bản gốc.
4. Gắn vào kịch bản lừa đảoKẻ xấu tạo cảm giác khẩn cấp để thúc ép chuyển tiền hoặc cung cấp thông tin.

Nguồn tham khảo: McAfee – AI voice cloning scams.

Con số cần đặt đúng bối cảnh

Giọng nói giả đang làm giảm độ tin cậy của cuộc gọi

Các khảo sát dưới đây có phạm vi và phương pháp khác nhau. Chúng dùng để nhận diện xu hướng, không phải để suy ra tỷ lệ rủi ro chính xác cho từng cá nhân hay doanh nghiệp Việt Nam.

3 giâyMẫu âm thanh trong thử nghiệmMcAfee cho biết một trường hợp thử nghiệm chỉ cần ba giây để tạo bản clone đạt 85% mức khớp theo thang đánh giá nội bộ.
85%Mức khớp trong thử nghiệmKhông phải cam kết chất lượng cho mọi công cụ, nhưng cho thấy rào cản tạo giọng giả đã thấp hơn nhiều.
31%Từng nhận cuộc gọi deepfakeKết quả khảo sát 12.000 người tiêu dùng tại sáu quốc gia trong báo cáo State of the Call 2026 của Hiya.
77%Nạn nhân báo cáo mất tiềnTrong khảo sát McAfee, tỷ lệ này áp dụng cho nhóm người cho biết từng nhận tin nhắn từ voice clone AI.

Nguồn: McAfee; Hiya, State of the Call 2026.

Vì sao nghe bằng tai ngày càng không đủ?

Giọng AI chất lượng thấp có thể vẫn để lộ nhịp nói đều, ngắt câu lạ hoặc cảm xúc chưa tự nhiên. Nhưng đó không phải một cách phòng vệ đáng tin. Kẻ lừa đảo thường chọn đoạn hội thoại ngắn, nói trong môi trường “sóng yếu”, xen tiếng ồn hoặc đẩy nạn nhân vào trạng thái hoảng loạn. Trong hoàn cảnh đó, một chi tiết hơi lạ rất dễ bị bỏ qua.

Các nghiên cứu về khả năng nhận diện âm thanh tổng hợp đều cho thấy con người gặp khó khăn đáng kể, và độ chính xác phụ thuộc vào mẫu thử cũng như công cụ tạo giọng. Vì vậy, thay vì tự tin rằng “nghe là biết”, hãy coi bất kỳ cuộc gọi nào yêu cầu tiền, mật khẩu, mã OTP hoặc thay đổi thông tin quan trọng là một yêu cầu phải xác minh độc lập.

Rủi ro này đã ở rất gần

Deepfake không chỉ nhắm vào người nổi tiếng. Người dùng phổ thông có thông tin cá nhân, tài khoản ngân hàng, dữ liệu mạng xã hội hoặc các mối quan hệ gia đình rõ ràng thường là mục tiêu phù hợp cho các kịch bản mạo danh. Với doanh nghiệp, một cuộc gọi giả giọng lãnh đạo có thể nhắm tới yêu cầu chuyển khoản, thay đổi tài khoản nhận tiền hoặc lấy thông tin nội bộ.

Các cảnh báo tại Việt Nam cũng nhắc tới nguy cơ AI bị dùng để giả giọng, hình ảnh và tạo nội dung lừa đảo thuyết phục hơn. VTV lưu ý công nghệ deepfake có thể làm ranh giới thật – giả trở nên khó nhận biết; các báo cáo an toàn thông tin của Viettel Cyber Security cũng đặt deepfake trong nhóm rủi ro cần doanh nghiệp và người dùng theo dõi. Điều đó không có nghĩa phải sợ mọi cuộc gọi, nhưng một yêu cầu bất thường không nên được xử lý chỉ dựa vào giọng nói.

Video tham khảo: phóng sự về rủi ro lừa đảo bằng deepfake. Video bổ sung bối cảnh để người xem nhận diện áp lực và thủ đoạn thường gặp trong các tình huống giả mạo.

Bốn lớp xác minh đơn giản trước khi làm theo yêu cầu khẩn

Không có một ứng dụng hay một mẹo nghe nào giải quyết được tất cả. Điều hữu ích hơn là một quy trình đủ đơn giản để bạn vẫn nhớ làm khi đang hoảng.

1. Dừng lại trước khi chuyển tiền

“Khẩn cấp” là công cụ tâm lý phổ biến của kẻ lừa đảo. Hãy tạm dừng, không cung cấp OTP, mật khẩu hay chuyển khoản chỉ vì người gọi thúc giục.

2. Gọi lại bằng số đã lưu

Không gọi lại số vừa xuất hiện. Hãy dùng số liên hệ đã biết của người thân, đồng nghiệp hoặc đơn vị để xác minh qua một kênh độc lập.

3. Dùng câu hỏi hoặc mật khẩu gia đình

Chuẩn bị một câu hỏi mà thông tin không công khai, hoặc một cụm từ chỉ người trong nhà biết. Tránh chọn ngày sinh, địa chỉ hay dữ liệu dễ tìm trên mạng xã hội.

4. Với doanh nghiệp, luôn có bước phê duyệt thứ hai

Yêu cầu chuyển tiền, đổi tài khoản nhận tiền hay chia sẻ dữ liệu nhạy cảm cần được xác nhận qua email nội bộ, hệ thống phê duyệt hoặc người có thẩm quyền khác.

Câu hỏi thường gặp

Làm sao phân biệt giọng nói AI và giọng người thật qua điện thoại?

Rất khó để kết luận chỉ bằng tai, nhất là trong cuộc gọi ngắn hoặc có áp lực tâm lý. Có thể để ý dấu hiệu bất thường, nhưng cách an toàn hơn là xác minh qua số đã lưu, một kênh liên lạc khác hoặc câu hỏi riêng đã thống nhất từ trước.

CallBot AI có phải là một dạng deepfake không?

Không. CallBot AI của Tekomi dùng giọng nói tổng hợp minh bạch để tư vấn và chăm sóc khách hàng theo kịch bản doanh nghiệp xác nhận; người nghe được thông báo rõ đang tương tác với hệ thống tự động. Deepfake là việc giả mạo danh tính hoặc giọng của một người có thật để đánh lừa người nghe. Khác biệt nằm ở sự minh bạch, quyền đồng ý và mục đích sử dụng.

Có nên xóa toàn bộ video, voice message trên mạng xã hội?

Không nhất thiết. Điều quan trọng là xem lại mức độ công khai của nội dung, hạn chế chia sẻ thông tin nhạy cảm kèm mẫu giọng và xây thói quen xác minh khi có yêu cầu liên quan đến tiền hoặc tài khoản. An toàn nhất vẫn là quy trình, không phải cố giấu hoàn toàn giọng nói.

Minh bạch trong mỗi cuộc gọi là một phần của niềm tin

CallBot AI của Tekomi luôn giới thiệu rõ đây là hệ thống tự động ngay từ đầu cuộc gọi. Doanh nghiệp có thể tự động hóa tư vấn, chăm sóc và chốt lịch hẹn, đồng thời giữ khách hàng biết chính xác họ đang tương tác với ai.

Nguồn tham khảo