Một thuật toán học máy mới đang giúp Google xác định từ nào trong truy vấn tìm kiếm là quan trọng nhất — và cách các từ đó liên quan đến nhau.

Đối với công cụ tìm kiếm mang tên Google, việc trả về kết quả chính xác đòi hỏi phải hiểu được người dùng thực sự đang hỏi gì. Để làm được điều đó, hệ thống cần tập trung vào các từ khóa có nghĩa trong truy vấn và bỏ qua phần còn lại. Những từ như “a” hay “the” chẳng hạn, thường có thể bỏ qua một cách an toàn.
Vấn đề là có rất nhiều truy vấn mà ngay cả một công cụ tìm kiếm thông minh như Google cũng khó xác định các từ liên quan với nhau như thế nào và từ nào thực sự quan trọng. Một ví dụ điển hình: Nếu người dùng tìm kiếm “can you get medicine for someone pharmacy” (có thể lấy thuốc cho người khác tại nhà thuốc không), từ “someone” (người khác) hoàn toàn mang tính quyết định, vì đây là cách viết tắt của “someone other than myself” (người khác ngoài tôi). Một người bình thường có thể suy ra điều đó, nhưng một thuật toán tìm kiếm truyền thống thì không.
Tuy nhiên, Google hiện đang triển khai bản cập nhật cho công cụ tìm kiếm tiếng Anh nhằm giúp hệ thống hiểu sâu hơn các truy vấn tinh tế như vậy, từ đó cung cấp kết quả liên quan hơn. Với truy vấn nêu trên, kết quả hiện được bổ sung một “đoạn trích nổi bật” đề cập đến vấn đề cụ thể là lấy đơn thuốc thay cho người khác. (Trước đây, đoạn trích có nhắc đến đơn thuốc nhưng không trả lời đúng trọng tâm của câu hỏi.)
Tôi đã tham dự buổi giới thiệu báo chí tại trụ sở Google đầu tuần này, nơi một số lãnh đạo mảng tìm kiếm của công ty trình bày các ví dụ về kết quả cải tiến của thuật toán mới và giải thích công nghệ đứng sau những cải tiến đó. Kỳ vọng được đặt ra rất cao: Phó Chủ tịch phụ trách tìm kiếm Pandu Nayak gọi đây là “thay đổi lớn nhất trong năm năm qua và có lẽ là một trong những thay đổi lớn nhất kể từ khi công ty được thành lập.”

BERT VẬN HÀNH
Những cải tiến mới này dựa trên công nghệ do Google phát triển có tên là BERT, viết tắt của Bidirectional Encoder Representations from Transformers. Những người không phải nhà khoa học AI không cần lo lắng về encoder, representation hay transformer là gì. Về cơ bản, BERT huấn luyện các thuật toán học ngôn ngữ máy bằng cách đưa vào chúng các đoạn văn bản có một số từ bị xóa. Nhiệm vụ của thuật toán là đoán các từ còn thiếu — một bài tập mà máy tính làm rất tốt và là cách hiệu quả để huấn luyện thuật toán hiểu văn bản. Về mặt khả năng lĩnh hội, công nghệ này giúp “biến ngôn ngữ từ khóa thành ngôn ngữ thực sự,” theo lời Giám đốc tìm kiếm Google Ben Gomes.
“Văn bản càng nhiều, khả năng hiểu càng tốt,” — Jeff Dean, Phó Chủ tịch Cấp cao phụ trách nghiên cứu của Google cho biết — và may mắn thay, không thiếu tài liệu văn bản để Google đưa vào BERT. (Ngoài ra, thành phần “Bidirectional” trong từ viết tắt phản ánh việc kỹ thuật này thoát khỏi thực hành thông thường là phân tích văn bản theo từng từ từ trái sang phải.)
Nhờ các siêu máy tính tự thiết kế để huấn luyện mô hình học máy, Google đang ứng dụng BERT để giúp thuật toán tìm kiếm hiểu sâu hơn các truy vấn và các trang web chứa thông tin liên quan. Nhiều công ty công nghệ khác cũng đã áp dụng BERT và đang sử dụng các biến thể riêng cho nhiều mục đích khác nhau: Facebook chẳng hạn đang dùng phiên bản có tên RoBERTa trong nghiên cứu chatbot. Tuy nhiên, những điều chỉnh mới trong tìm kiếm của Google là một trong những ví dụ đầu tiên về việc BERT rời phòng thí nghiệm để cải thiện một trong những dịch vụ được sử dụng rộng rãi nhất thế giới.
Quá trình huấn luyện BERT mới chỉ là một trong nhiều yếu tố mà Google sử dụng để chọn kết quả cho mỗi truy vấn; công ty cho biết BERT sẽ được áp dụng trong khoảng 1 trên 10 lượt tìm kiếm. Tuy nhiên, 10% đó sẽ bao gồm những truy vấn trước đây có khả năng cao làm Google bó tay, chẳng hạn như “How old was Taylor Swift when Kanye went onstage?” (Taylor Swift bao nhiêu tuổi khi Kanye bước lên sân khấu?) hay “Do estheticians stand a lot at work?” (Các chuyên viên thẩm mỹ có phải đứng nhiều khi làm việc không?)
Những cải tiến mới này dựa trên công nghệ do Google phát triển có tên là BERT, viết tắt của Bidirectional Encoder Representations from Transformers. Những người không phải nhà khoa học AI không cần lo lắng về encoder, representation hay transformer là gì. Về cơ bản, BERT huấn luyện các thuật toán học ngôn ngữ máy bằng cách đưa vào chúng các đoạn văn bản có một số từ bị xóa. Nhiệm vụ của thuật toán là đoán các từ còn thiếu — một bài tập mà máy tính làm rất tốt và là cách hiệu quả để huấn luyện thuật toán hiểu văn bản. Về mặt khả năng lĩnh hội, công nghệ này giúp “biến ngôn ngữ từ khóa thành ngôn ngữ thực sự,” theo lời Giám đốc tìm kiếm Google Ben Gomes.
“Văn bản càng nhiều, khả năng hiểu càng tốt,” — Jeff Dean, Phó Chủ tịch Cấp cao phụ trách nghiên cứu của Google cho biết — và may mắn thay, không thiếu tài liệu văn bản để Google đưa vào BERT. (Ngoài ra, thành phần “Bidirectional” trong từ viết tắt phản ánh việc kỹ thuật này thoát khỏi thực hành thông thường là phân tích văn bản theo từng từ từ trái sang phải.)
Nhờ các siêu máy tính tự thiết kế để huấn luyện mô hình học máy, Google đang ứng dụng BERT để giúp thuật toán tìm kiếm hiểu sâu hơn các truy vấn và các trang web chứa thông tin liên quan. Nhiều công ty công nghệ khác cũng đã áp dụng BERT và đang sử dụng các biến thể riêng cho nhiều mục đích khác nhau: Facebook chẳng hạn đang dùng phiên bản có tên RoBERTa trong nghiên cứu chatbot. Tuy nhiên, những điều chỉnh mới trong tìm kiếm của Google là một trong những ví dụ đầu tiên về việc BERT rời phòng thí nghiệm để cải thiện một trong những dịch vụ được sử dụng rộng rãi nhất thế giới.
Quá trình huấn luyện BERT mới chỉ là một trong nhiều yếu tố mà Google sử dụng để chọn kết quả cho mỗi truy vấn; công ty cho biết BERT sẽ được áp dụng trong khoảng 1 trên 10 lượt tìm kiếm. Tuy nhiên, 10% đó sẽ bao gồm những truy vấn trước đây có khả năng cao làm Google bó tay, chẳng hạn như “How old was Taylor Swift when Kanye went onstage?” hay “Do estheticians stand a lot at work?”.

Xét cho cùng, BERT có lẽ sẽ không tạo ra tác động rõ rệt như các cột mốc trước đây của Google như tìm kiếm toàn cầu và đồ thị tri thức — cả hai đều đã thay đổi căn bản cách hiển thị kết quả tìm kiếm theo những cách không thể không nhận ra. Với sự bổ sung của BERT, kết quả trông vẫn như cũ; nếu BERT cải thiện chúng, người dùng sẽ được hưởng lợi — nhưng sẽ không bao giờ biết rằng kết quả có thể đã kém hơn nếu không có BERT.
Dù vậy, Nayak thẳng thắn thừa nhận có những trường hợp kết quả tìm kiếm tích hợp BERT lại kém hơn kết quả cũ. Tại buổi họp báo, ông đưa ra một ví dụ: Khi hỏi “What state is south of Nebraska?” (Bang nào ở phía nam Nebraska?), kết quả BERT lại trả về thông tin về khu phố South Nebraska ở Tampa, Florida — không chỉ kém liên quan hơn phiên bản không dùng BERT mà còn hoàn toàn vô dụng. Tuy nhiên, các thử nghiệm của Google cho thấy những trường hợp như vậy đủ hiếm để việc sử dụng BERT vẫn mang lại lợi thế tổng thể rõ ràng, và lợi thế này sẽ tăng lên khi công ty tiếp tục tinh chỉnh công nghệ theo thời gian.
“BERT không phải là viên đạn thần kỳ giải quyết mọi vấn đề, nhưng nó giải quyết được rất nhiều vấn đề,” Nayak nói. “Vẫn còn nhiều việc phải làm.”
Tác giả: HARRY MCCRACKEN
Nguồn: https://www.fastcompany.com/90422132/google-just-got-better-at-understanding-your-trickiest-searches









