새로운 머신러닝 알고리즘이 Google이 검색어에서 어떤 단어가 가장 중요한지, 그리고 단어들이 서로 어떻게 연관되는지 파악하는 데 도움을 주고 있습니다.

Google 검색 엔진에 있어 적절한 결과를 제공하는 것은 사용자가 무엇을 원하는지 이해하는 데서 시작됩니다. 이를 위해서는 검색어 내의 의미 있는 키워드에 집중하고 나머지는 무시해야 합니다. 예를 들어 “a”나 “the” 같은 단어들은 일반적으로 무시해도 무방합니다.
문제는 Google처럼 뛰어난 검색 엔진조차 단어들 사이의 관계와 어떤 단어가 중요한지 판단하기 어려운 검색어가 많다는 점입니다. 회사가 제시하는 한 가지 예로, 사용자가 “can you get medicine for someone pharmacy”(약국에서 다른 사람 약을 대신 받을 수 있나요)라고 검색하면 “someone”(다른 사람)이 결정적으로 중요합니다. 이는 “나 자신이 아닌 다른 누군가”를 뜻하는 표현이기 때문입니다. 사람이라면 자연스럽게 추론할 수 있지만, 전통적인 검색 알고리즘은 그렇지 못했습니다.
이제 Google은 영어 검색 엔진에 이러한 미묘한 검색어를 보다 깊이 이해할 수 있도록 업데이트를 적용하여 더욱 관련성 높은 결과를 제공하고 있습니다. 앞서 언급한 검색의 경우 이제는 타인의 처방전을 대신 수령하는 구체적인 문제를 다루는 “추천 스니펫”이 상단에 노출됩니다. (기존에는 처방전 관련 내용이 포함되기는 했으나 검색어의 핵심을 제대로 다루지 못했습니다.)
이번 주 초 Google 본사에서 열린 언론 시사회에 참석했습니다. 그 자리에서 Google 검색 담당 임원들이 새로운 알고리즘으로 개선된 결과 사례를 보여주고, 이에 적용된 신기술을 설명했습니다. 기대치는 매우 높게 설정되었으며, 검색 담당 부사장 Pandu Nayak은 이를 “지난 5년간 가장 큰 변화이자 어쩌면 창립 이래 가장 큰 변화 중 하나”라고 말했습니다.

BERT의 작동 원리
이번 개선은 Google이 개발한 BERT(Bidirectional Encoder Representations from Transformers) 기술을 활용합니다. AI 전문가가 아니라면 인코더, 표현, 트랜스포머가 무엇인지 몰라도 됩니다. 핵심은 BERT가 일부 단어가 제거된 텍스트 단락을 머신러닝 알고리즘에 제공하여 학습시킨다는 점입니다. 알고리즘의 과제는 빠진 단어를 추측하는 것인데, 이는 컴퓨터가 잘 수행하는 작업이며 텍스트 이해를 효율적으로 학습시키는 효과적인 방법입니다. 이해 측면에서 볼 때 이 기술은 “키워드 중심의 언어를 자연 언어로 전환하는” 데 도움이 된다고 Google 검색 최고책임자 Ben Gomes는 말했습니다.
“텍스트가 많을수록 이해도가 높아집니다”라고 Google 수석 부사장(연구 담당) Jeff Dean은 말했습니다. 다행히 Google이 BERT에 투입할 수 있는 텍스트 자료는 부족하지 않습니다. (참고로, 약어의 “Bidirectional”(양방향)은 이 기술이 텍스트를 왼쪽에서 오른쪽으로 한 단어씩 분석하는 기존 방식에서 벗어났음을 의미합니다.)
Google은 자체 설계한 슈퍼컴퓨터로 머신러닝 모델을 학습시키며, BERT를 검색 알고리즘에 적용해 검색어와 관련 정보를 담은 웹 페이지에 대한 이해를 높이고 있습니다. 다른 기술 기업들도 BERT를 도입하여 다양한 용도에 자체 변형 버전을 활용하고 있습니다. 예를 들어 Facebook은 RoBERTa라는 버전을 챗봇 연구에 사용하고 있습니다. 이번 Google 검색 개선은 BERT가 연구실을 벗어나 세계에서 가장 널리 사용되는 서비스 중 하나를 개선한 초기 사례입니다.
새로운 BERT 학습은 Google이 검색 결과를 선택할 때 활용하는 여러 요소 중 하나에 불과하며, 회사에 따르면 약 10건 중 1건의 검색에 적용됩니다. 그러나 그 10%에는 과거 Google을 어렵게 만들었던 검색어——예를 들어 “How old was Taylor Swift when Kanye went onstage?”(Kanye가 무대에 올랐을 때 Taylor Swift는 몇 살이었나?)나 “Do estheticians stand a lot at work?”(에스테티션은 근무 중 많이 서 있나?)——가 포함될 것입니다.
이번 개선은 Google이 개발한 BERT(Bidirectional Encoder Representations from Transformers) 기술을 활용합니다. AI 전문가가 아니라면 인코더, 표현, 트랜스포머가 무엇인지 몰라도 됩니다. 핵심은 BERT가 일부 단어가 제거된 텍스트 단락을 머신러닝 알고리즘에 제공하여 학습시킨다는 점입니다. 알고리즘의 과제는 빠진 단어를 추측하는 것인데, 이는 컴퓨터가 잘 수행하는 작업이며 텍스트 이해를 효율적으로 학습시키는 효과적인 방법입니다. 이해 측면에서 볼 때 이 기술은 “키워드 중심의 언어를 자연 언어로 전환하는” 데 도움이 된다고 Google 검색 최고책임자 Ben Gomes는 말했습니다.
“텍스트가 많을수록 이해도가 높아집니다”라고 Google 수석 부사장(연구 담당) Jeff Dean은 말했습니다. 다행히 Google이 BERT에 투입할 수 있는 텍스트 자료는 부족하지 않습니다. (참고로, 약어의 “Bidirectional”(양방향)은 이 기술이 텍스트를 왼쪽에서 오른쪽으로 한 단어씩 분석하는 기존 방식에서 벗어났음을 의미합니다.)
Google은 자체 설계한 슈퍼컴퓨터로 머신러닝 모델을 학습시키며, BERT를 검색 알고리즘에 적용해 검색어와 관련 정보를 담은 웹 페이지에 대한 이해를 높이고 있습니다. 다른 기술 기업들도 BERT를 도입하여 다양한 용도에 자체 변형 버전을 활용하고 있습니다. 예를 들어 Facebook은 RoBERTa라는 버전을 챗봇 연구에 사용하고 있습니다. 이번 Google 검색 개선은 BERT가 연구실을 벗어나 세계에서 가장 널리 사용되는 서비스 중 하나를 개선한 초기 사례입니다.
새로운 BERT 학습은 Google이 검색 결과를 선택할 때 활용하는 여러 요소 중 하나에 불과하며, 회사에 따르면 약 10건 중 1건의 검색에 적용됩니다. 그러나 그 10%에는 과거 Google을 어렵게 만들었던 검색어——예를 들어 “How old was Taylor Swift when Kanye went onstage?”나 “Do estheticians stand a lot at work?”——가 포함될 것입니다..

결국 BERT는 통합 검색이나 지식 그래프——두 기능 모두 검색 결과 표시 방식을 근본적으로 바꾸어 누구나 변화를 체감할 수 있었습니다——처럼 뚜렷한 영향을 미치지는 않을 것입니다. BERT가 추가되어도 검색 결과의 겉모습은 그대로입니다. BERT가 결과를 개선한다면 혜택을 누리게 되지만, BERT가 없었다면 결과가 더 나빴을 것이라는 사실은 알 수 없습니다.
그럼에도 Nayak은 BERT가 적용된 검색 결과가 기존 결과보다 나쁜 경우도 있음을 솔직하게 인정합니다. 언론 행사에서 그는 한 사례를 보여주었습니다. “What state is south of Nebraska?”(네브래스카주 남쪽에 있는 주는 어디인가?)라고 질문했을 때, BERT 결과는 플로리다주 탬파에 있는 사우스 네브래스카 지역에 관한 것이었는데, 이는 BERT를 사용하지 않은 이전 결과보다 관련성이 낮았을 뿐 아니라 전혀 쓸모가 없었습니다. 그러나 Google의 테스트 결과 이러한 사례는 충분히 드물어서 BERT 사용이 전반적으로 명확한 이점을 제공하며, 시간이 지나며 기술을 개선할수록 그 이점은 더욱 커질 것입니다.
“BERT는 모든 문제를 해결하는 마법의 해결책은 아니지만, 많은 문제 영역을 해결합니다”라고 Nayak은 말했습니다. “아직 할 일이 많이 남아 있습니다.”
작성자: HARRY MCCRACKEN
출처: https://www.fastcompany.com/90422132/google-just-got-better-at-understanding-your-trickiest-searches









