이슈페이퍼_2024-8
이북 원문에서 글자만 옮긴 전체 텍스트입니다. 표·그림·사진과 원래 모양은 이북에서 확인하세요.
KOSAC
이슈 페이퍼
/심층분석
노벨상과 인공지능, 새로운 과학 시대의 서막
2024.8호
작성자 | 장미경(한국과학창의재단) 편 집 | 정책기획실 발 행 | 한국과학창의재단 발행일 | 2024.10.29
ISSUE PAPER / CONTENTS
CONTENTS
인공지능 연구자들의 노벨상 수상 의미
노벨물리학상과 인공신경망
통계물리학 개념을 활용한 인공지능, 볼츠만 머신
인공신경망 모델로 물리학 분야의 발전 이끌어
노벨화학상과 단백질 구조를 예측하는 인공지능
아미노산 배열로부터 단백질의 3차원 구조 예측
알파폴드2의 단백질 구조 예측 과정
새로운 단백질 설계를 통한 생명과학의 진보
물리학적 배경을 기반으로 한 연상 기억, 홉필드 네트워크
인간과 인공지능이 함께하는 과학 발전의 새로운 지평
노벨상과 인공지능, 새로운 과학 시대의 서막
장미경 선임연구원·과학언론학 박사
올해 노벨상 과학 분야의 주요 이슈와 키워드는 ‘인공지능’이 차지했다. 2024년 10월, 스웨덴 왕립 과학 아카데미는 2024 노벨물리학상과 노벨화학상의 주인공으로 인공지능 분야에서 활약한 연구자들을 선택하면서 과학계에 새로운 패러다임의 도래를 알리는 신호탄을 쏘아 올렸다. 이는 인공지능 기술이 과학계에서 점점 더 중요한 역할 수행자로 기능함을 입증하는 상징적 사건이자, 인공지능이 다학제적 접근을 통해 세상을 어떻게 변화시키고 있는지 현시점에서 실질적으로 인식되고 있음을 보여주는 결과이다.
인공지능 연구자들의 노벨상 수상 의미
미국 프린스턴대 분자생물학과 명예교수인 존 홉필드(John Hopfield)와 캐나다 토론토대 컴퓨터과학과 명예교수인 제프리 힌턴(Geoffrey Hinton)은 인공지능의 기초를 다지고 인공신경망을 통해 혁신적 성과를 창출한 기여를 인정받아 노벨물리학상의 영광을 안았다. 미국 워싱턴대 생화학과 교수인 데이비드 베이커(David Baker), 미국 구글 딥마인드의 최고경영자(CEO) 데미스 하사비스(Demis Hassabis), 수석연구원 존 점퍼(John Jumper)는 인공지능을 활용해 단백질 구조 규명 및 예측, 새로운 단백질 설계 연구의 서막을 연 성과로 노벨화학상 수상의 주인공이 되었다. 전통적인 학문의 경계를 허물고 인공지능에 주목한 노벨상 선정 결과를 계기로 과학자들은 인공지능을 효율적인 연구 도구로 인식하면서 인공지능에 대한 신뢰의 폭을 넓힐 것으로 예측되며, 인공지능의 단순한 유행을 뛰어넘어 기술적 진화를 좀 더 심층적으로 탐구하고 적용하려는 다학제 연구가 한층 활발해질 것으로 보인다. 이에 따라 이번 노벨상 결과는 인공지능 기술의 연구와 발전이 과학기술 분야의 최전선에서 향후 어떤 가치와 의미를 지닐지 보여주는 중요한 이정표가 될 것으로 전망된다. 과학자 대다수는 인공지능 분야의 연구자가 노벨물리학상 수상자로 선정된 이변을 환영하는 분위기이지만, 한편으로는 물리학, 화학 등 기초 학문 영역에서 인공지능
노벨물리학상과 인공신경망
분야의 연구자들이 선정된 결과에 대해 일부 연구자들은 거센 반감을 드러냈다. 영국 임페리얼 칼리지 런던의 천체물리학부 교수인 조나단 프리차드(Jonathan Pritchard)는 자신의 소셜미디어 X에 “노벨상이 인공지능 과대 열풍에 휘말린 것 같다”, “말문이 막혔다”, “나도 기계학습과 인공신경망을 좋아하지만, 이것이 물리학의 발견이라고 보기는 어렵다” 등의 강한 표현으로 노벨물리학상 수상자 선정 결과에 대한 반발과 우려를 나타냈다. 영국의 과학 학술지 네이처(Nature)의 보도에 따르면, 독일 뮌헨 수학철학센터의 이론물리학자이자 과학 커뮤니케이터인 사빈 호센펠더(Sabine Hossenfelder) 역시 2024년 노벨물리학상을 받은 연구가 컴퓨터과학에 속한다고 주장하면서 “노벨상은 물리학, 그리고 물리학자들이 스포트라이트를 받을 수 있는 드문 기회인데, 올해는 그렇지 않았다”라고 실망감을 표현했다. 일부의 반발과 우려에도 불구하고 이번 결과는 인공지능의 핵심 기술인 머신러닝(ML, Machine Learning)과 인공신경망(ANN, Artificial Neural Network)의 발전에 있어 통계물리학, 생물물리학, 계산물리학 등 물리학적 접근이 얼마나 중요한지를 내포하고 있다. 저서 ‘기계가 학습하는 이유’(Why Machines Learn)로 잘 알려진 과학 저널리스트 아닐 아난타스와미(Anil Ananthaswamy)는 “노벨물리학상을 수상한 연구는 인공지능 기술에 의해 촉진되었지만, 궁극적으로는 물리학의 개념과 기술에 기반하고 있다”고 강조했다.
노벨물리학상 수상자들의 연구를 좀 더 구체적으로 살펴보자. 물리학의 기본 개념과 방법을 활용한 이들 연구에서 존 홉필드는 정보를 저장하고 재구성할 수 있는 정보처리 구조를 만들었고, 제프리 힌턴은 데이터에서 독립적으로 속성을 발견하는 방법을 개발했다. 이들의 연구는 머신러닝의 핵심 개념 형성과 대형 인공신경망 발전에 중요한 역할을 해내면서 현재 인류가 누리는 인공지능 기술 발전과 혜택의 근간을 마련했다고 평가받는다.
그림 1 | 머신러닝은 지난 15~20년 동안 폭발적으로 발전했으며, 인공신경망 구조를 활용하고 있다.
먼저 홉필드의 연구는 물리학에서 물질의 특성을 설명하는 원리가 적용된다. 분자생물학 교수이자 물리학, 인지심리학, 인공지능 분야에 깊은 관심과 흥미를 갖던 그는 1982년, 이론 생물학자로서 물리학적 배경을 기반으로 뇌의 신경세포인 뉴런과 시냅스 원리를 컴퓨터 회로에 적용해 가상 뉴런 간 연결을 물리적인 힘으로 설명하기 위한 ‘홉필드 네트워크’(Hopfield Network)를 제안했다. 홉필드 네트워크는 ‘연상 기억’(associative memory)이라는 개념을 통해 이미지의 저장 및 재구성을 구현하는 방식으로 작동한다. 홉필드는 연상 기억 개념에 대해 골짜기 지형이 형성되는 것과 유사한 방식으로 정보가 저장된다고 설명했다. 네트워크가 훈련되면 저장된 모든 패턴에 대해 가상 에너지 지형에 밸리를 생성한다는 것이다. 예를 들어 훈련된 네트워크에 왜곡되거나 불완전한 패턴이 입력되면 이는 이 환경의 경사면 아래로 공을 떨어뜨리는 것과 유사하다. 공은 오르막으로 둘러싸인 곳에 도달할 때까지 굴러가며, 같은 방식으로 네트워크는 더 낮은 에너지를 향해 나아가면서 가장 가까운 저장 패턴을 찾는다. 이에 따라 홉필드 네트워크는 기능 단위의 연결점인 노드들이 단계적으로 작동하고 피드백을 반영하면서 불완전하거나 왜곡된 이미지에 대한 실제 이미지를 추측한다.
1) Hopfield, J. J. (1982). Neural networks and physical systems with emergent collective computational abilities. Proceedings of the national academy of sciences, 79(8), 2554-2558.
https://www.nobelprize.org
1)
물리학적 배경을 기반 으로 한 연상 기억, 홉필드 네트워크
인공신경망에서 인간 뇌의 뉴런은 서로 다른 값을 가진 노드이고, 각 노드의 연결은 신경세포들을 연결하는 시냅스라고 할 수 있다. 그는 각 노드가 픽셀에 해당한다고 상상하고 노드 간 에너지를 최소화하는 방법으로 이미지 복원 방식을 설계했다. 즉 노드들은 신경세포 간 연결 강도에 따라 서로에게 영향을 미치는데, 어떠한 노드 연결이 최적의 정보처리를 위한 상태인지 찾아내려는 것이다.
그림 2 | 뇌의 신경망은 살아있는 세포인 뉴런으로 구축되는데, 뉴런은 시냅스를 통해 서로에게 신호를 보낼 수 있다. 무언가를 배운다고 가정할 때 어떤 뉴런은 연결이 강해지고 다른 뉴런은 약해진다. 인공신경망은 값으로 코딩된 노드로 구축되는데, 노드는 서로 연결되어 있으며 네트워크가 훈련되면 동시에 활성화되는 노드 간 연결이 더 강해지고 반대의 경우 약해진다.
예를 들어 서로 영향을 미치는 네트워크가 불완전하거나 왜곡된 이미지를 입력받았을 경우, 노드 간 연결 강도를 조절하는 방식으로 동작하면서 해당 이미지와 가장 유사한 저장 이미지를 찾아내는 과정을 거쳐 업데이트된다. 뇌가 관련 정보를 바탕으로 단어나 개념을 기억하려는 것처럼, 저장 패턴을 재방문하고 정보를 검색할 수 있는 연상 기억의 형태로 작동하는 것이다. 홉필드 이전의 인공신경망 알고리즘 계산과 학습은 일방향으로 진행됐지만, 홉필드 네트워크는 노드들이 단계적으로 작동하고 피드백을 반영하면서 불완전하거나 왜곡된 이미지에 대한 실제 이미지를 추측한다. 홉필드는 간단한 시스템 내에서 네트워크의 학습 가능성을 확인·입증함으로써 인공신경망 훈련의 토대를 구축했다.
https://www.nobelprize.org
통계물리학 개념을 활용한 인공지능, 볼츠만 머신
그림 3 | 존 홉필드는 연상 기억 개념에 대해 골짜기 지형이 형성되는 것과 유사한 방식으로 정보가 저장된다고 설명했다. 네트워크가 훈련되면 저장된 모든 패턴에 대해 가상 에너지 지형에 밸리를 생성한다는 것이다. 이에 따라 홉필드 네트워크는 노드들이 단계적으로 작동하고 피드백을 반영하면서 불완전하거나 왜곡된 이미지에 대한 실제 이미지를 추측한다.
힌턴은 이러한 홉필드 네트워크 연구를 기반으로 통계물리학의 개념을 기계 학습에 도입해 ‘볼츠만 머신’(Boltzmann machine) 모델로 확장했다. 볼츠만 머신은 오스트리아 물리학자 루트비히 볼츠만(Ludwig Boltzmann)의 이름에서 따온 용어이다. 볼츠만은 기체 분자가 어떻게 운동하는지를 설명하기 위해 확률적·통계적 분포와 에너지 역학 해석으로 이론화하면서 통계물리학의 기초를 마련했다. 이러한 볼츠만의 이론은 인지 과학 커뮤니티와 기계 학습 분야에서 제프리 힌턴, 얀 르쿤(Yann LeCun) 등의 학자들에 의해 볼츠만 머신 개념으로 확장되고 핵심 원리로 활용되면서 대중에게 알려지기 시작했다. 힌턴은 신경망의 학습 능력을 극대화하기 위해 ‘제한된 볼츠만 머신’(Restricted Boltzmann Machine)으로 다층 신경망 모델의 사전 훈련을 거친 뒤 가중치를 미세 조정하면서 학습을 수행할 수 있는 ‘역전파’(backpropagation) 알고리즘을 개발했고, 이는 딥러닝의 핵심 기술로 적용되어 생성형 인공지능 기술의 비약적 발전을 이끌었다.
2)
2) Rumelhart, D. E., Hinton, G. E., & Williams, R. J. (1986). Learning representations by back-propagating errors. nature, 323(6088), 533-536.
https://www.nobelprize.org
볼츠만 머신은 ‘가시 노드’(visible nodes)와 ‘숨겨진 노드’(hidden nodes)라는 두 가지 유형의 노드로 구성된다. 먼저 가시 노드는 외부에서 들어오는 데이터나 정보를 나타낸다. 예를 들어 이미지 데이터의 픽셀값을 가시 노드로 표현할 수 있다. 숨겨진 노드는 가시 노드와 연결되어 있으며, 데이터의 잠재적 구조나 패턴을 학습하는 데 중요한 역할을 한다. 또한 숨겨진 노드는 가시 노드의 특성을 요약해 네트워크의 전체 에너지를 결정하는 데 기여한다. 볼츠만 머신은 각 노드의 상태를 업데이트해 전체 네트워크의 에너지를 최소화하는 방향으로 작동하는데, 크게 세 단계의 과정이 진행된다. 첫 번째는 상태 업데이트 단계이다. 각 노드는 다른 노드와 연결되어 있으며, 이 연결의 가중치에 따라 상태가 업데이트된다. 머신은 특정 확률에 따라 노드 상태를 변경해 다양한 패턴을 탐색한다. 다음 단계에서는 에너지를 계산한다. 머신 상태는 특정 에너지를 갖는데, 에너지가 낮을수록 그 상태는 더 안정적이다. 이에 따라 머신은 다양한 상태를 탐색하면서 에너지를 최소화하려고 한다. 마지막으로 패턴 생성 단계이다. 머신이 훈련된 후 가시 노드에 새로운 데이터가 들어오면 숨겨진 노드를 통해 새로운 패턴을 생성하는데, 이 때 가시 노드 패턴이 이전에 훈련된 패턴과 얼마나 유사한지에 따라 확률이 결정된다. 볼츠만 머신은 학습 과정에서 훈련 데이터에 따라 연결 가중치를 업데이트하는데, 같은 패턴이 반복적으로 많이 등장할수록 해당 패턴의 발생 확률은 높아지게 된다. 이렇게 훈련된 머신은 이전에 보지 못한 데이터에서도 친숙한 특성을 인식할 수 있다. 예를 들어 친구의 형제를 만났을 때 두 사람의 관계를 즉시 알아차리는 것과 유사한 방식으로, 새로운 예시 패턴을 기존 정보에 기반해 구별하는 것이다. 볼츠만 머신은 초기 생성 모델로 언급되는데, 이는 복잡한 데이터의 구조를 학습하고 유사한 패턴을 구별함으로써 새로운 정보를 생성할 수 있기 때문이다. 이에 따라 이 모델은 이미지 생성, 추천 시스템, 자연어 처리 등 다양한 분야에서 활용되고 있다.
인공신경망 모델로 물리학 분야의 발전 이끌어
그림 4 | 존 홉필드의 연상 기억은 모든 노드가 서로 연결되어 정보가 입력되고 읽히는 방식으로 구성된다. 반면, 제프리 힌턴의 볼츠만 머신은 두 개의 레이어로 구성되어 있으며, 가시 노드는 외부 정보를 입력받고 숨겨진 노드는 이 정보를 처리해 네트워크의 작동 방식에 영향을 미친다. 제한된 볼츠만 머신은 가시 노드와 숨겨진 노드 간의 연결만 존재하며, 훈련 과정을 통해 숨겨진 노드의 정보를 기반으로 다음 머신에 대한 훈련 작업을 수행할 수 있다.
결국 볼츠만 머신의 알고리즘은 복잡한 거미줄처럼 구성된 숨겨진 노드를 활용해 계산 효율성을 극대화함으로써 최적의 네트워크 상태를 유지한다는 개념이다. 즉 확률을 포함한 계층형 네트워크를 구축해 주어진 데이터의 특성을 스스로 학습·훈련함으로써 이미지를 인식·분류하고, 학습된 유형의 새로운 패턴으로 생성할 수 있다. 이러한 프로세스는 기존의 단계별 계산에 의존하는 소프트웨어와는 달리 복잡한 데이터로부터 학습할 수 있는 능력을 발휘한다. 노벨 물리학상 위원회 의장인 엘렌 문스(Ellen Moons)는 “인공신경망은 입자물리학, 재료과학, 천체물리학 등 다양한 물리학 분야의 주제 연구를 진전시키는 데 사용되었다”고 강조했다. 이들의 연구는 신소재 개발, 의료 진단에 있어 신뢰할 수 있는 신속한 의사결정, 언어 번역과 얼굴 인식 등 일상에서 활용되는 인공지능 기술 발전 등 다양한 분야에서 핵심 역할을 하고 있다. 주목할 만한 점은, 홉필드와 힌턴이 인공지능의 미래에 대해 서로 다른 시각을 가지고 있다는 것이다. 인공지능의 대부로 불리는 힌턴은 2023년 구글 퇴사를 시작으로, 인공지능의 위험성에 대해 지속적으로 경고하면서 초지능이 인류에게 위협이 될 수 있음을 강조해 왔다. 특히 힌턴은 다양한 매체와의 인터뷰를 통해 생성형 인공지능이 인간의 일자리를 빼앗고 빈부의 격차가 확대되는 사회 문제를 심화시킬 수 있다고 우려해 왔으며, 더 나아가 인공지능을 악용한 가짜뉴스 선거 조작, 인공지능이 공격 대상을 설정하는 자동화된 무기 시스템의 실용화 등 생성형 인공지능이 인간의 지능을 넘어서면서 인류를 지배할 가능성이 크다고 강하게
https://www.nobelprize.org
노벨화학상과 단백질 구조를 예측하는 인공지능
경고했다. 노벨상 발표 직후 진행된 전화 인터뷰에서도 힌턴은 인공지능이 산업 혁명처럼 우리 사회에 막대한 영향을 미칠 것이라고 언급하면서, 인류는 우리보다 더 똑똑한 것이 무엇인지에 대한 경험이 없으므로 인공지능으로 인해 발생할 수 있는 나쁜 결과에 대한 위협, 특히 그러한 결과가 통제 불가능하게 될 상황에 대해 걱정해야 한다고 강조했다. 반면, 홉필드는 인공지능의 긍정적인 가능성에 초점을 맞추어 복잡한 시스템이 어떻게 새로운 물리적 속성을 나타낼 수 있는지를 설명하는 데 중점을 두고 있다. 홉필드와 힌턴의 다른 시각에서 확인할 수 있는 것처럼 인류는 인공지능의 발전이 가져오는 기대와 희망 등 긍정적 변화는 물론, 통제 가능성에 대한 우려와 사회적 부작용 등 잠재적 위험에 대해 더욱 냉정하고 균형 있는 시각으로 접근해야 한다. 이런 차원에서 이번 노벨상 선정 결과는 인공지능 연구의 책임과 방향성, 예측 불가능한 변수와 사회적·윤리적 문제 등을 다시금 되새기게 만드는 계기가 될 수 있을 것으로 기대된다.
다음으로 노벨화학상 수상자들의 연구를 구체적으로 살펴보자. 구글 딥마인드의 데미스 하사비스와 존 점퍼, 미국 워싱턴대의 데이비드 베이커는 인공지능 기술을 통해 아미노산 서열에서 3D 단백질 구조를 예측하고 새로운 단백질 설계를 위한 계산 도구 개발 등 혁신적 성과를 인정받아 노벨화학상의 주인공이 되었다.
그림 5 | 단백질은 생명체의 모든 생리적 과정을 지배하는 핵심 요소다. 각 단백질의 고유한 기능은 아미노산 배열에 따라 결정되는 3차원 구조에 의해 좌우되는데, 화학자들이 아미노산 배열로부터 단백질의 3차원 구조를 예측하는 것은 반세기 이상 난제로 남아 있었다.
https://www.nobelprize.org
아미노산 배열로부터 단백질의 3차원 구조 예측
단백질 연구와 인공지능에 어떤 관련성이 있기에 인공지능 기술을 대표하는 구글 딥마인드의 연구자들이 화학상 분야의 수상자로 선정된 것일까. 단백질은 생명체의 모든 생리적 과정을 지배하는 핵심 요소다. 근육과 호르몬 생성, 화학 반응을 촉매하는 효소 역할까지 인체에서 매우 중요한 기능을 수행한다. 단백질은 20종의 아미노산으로 구성되며 무한한 조합으로 배열되는데, 그 구조와 기능은 생명체의 생명 유지에 필수적이다. 각 단백질의 고유한 기능은 아미노산 배열에 따라 결정되는 3차원 구조에 의해 좌우된다. 하지만 화학자들이 아미노산 배열로부터 단백질의 3차원 구조를 예측하는 것은 반세기 이상 난제로 남아 있었다.
그림 6 | 단백질은 수십 개의 아미노산부터 수천 개의 아미노산까지 구성될 수 있으며, 아미노산 끈은 단백질의 기능에 결정적인 3차원 구조로 접힌다.
1950년대부터 단백질 구조에 관한 연구를 진행한 존 켄드류(John Kendrew)와 맥스 퍼루츠(Max Perutz) 등 선구자들은 X선 결정학을 이용해 3차원 단백질 이미지를 최초로 생성하면서 1962년 노벨화학상을 수상했다. 하지만 기존의 X선 결정학 방법으로 전체 단백질 구조를 밝혀내기 위해서는 많은 시간과 자원이 소요된다. 상당한 발전이 이루어졌음에도 불구하고 단백질 구조에 대한 예측은 여전히 그 복잡함으로 인해 해결하기 어려운 과제였고, 사이러스 레빈탈(Cyrus Levinthal)의 역설은 작은 단백질이라도 이론적으로 천문학적 수의 형태를 가질 수 있음을 보여주었다. 1969년 제안된 사이러스 레빈탈의 역설은 단백질 접힘(folding)과 생물학적 구조 연구에 중요한 통찰을 제시한 것으로 알려져 있다. 이 역설의 핵심은 단백질이 아미노산으로 이루어진 긴 서열을 가지고 있을 때 가능한 접힘 상태의 수가 엄청나게
https://www.nobelprize.org
많아 단백질이 생물학적 기능 형태로 빠르게 접히는 것이 사실상 불가능하다는 것이다. 레빈탈에 따르면 100개의 아미노산으로 구성된 단백질이 있다고 가정했을 때, 각 아미노산이 가질 수 있는 구조적 변형은 매우 많아 이론적으로 가능한 접힘의 조합 수가 천문학적이다. 예를 들어 이 단백질이 각 접힘을 시도하는 데 1초 정도 걸린다고 가정하면, 우주가 존재한 시간보다 훨씬 긴 시간이 필요하다. 따라서 실제로 단백질이 빠르고 효율적으로 접히는 방법은 존재해야 한다. 생물체가 에너지를 최소화하는 경로로 접힘 과정을 진행하기 때문이다. 즉, 단백질이 접히는 과정은 복잡한 탐색이 아니라 생물학적 메커니즘에 의해 조절된다는 것을 시사한다. 결국 아미노산 서열이 어떤 특정한 단백질 구조를 만들어 내는지 예측하는 것은 이 분야 연구자들이 풀어야 할 궁극의 과제라고 할 수 있다. 이러한 과제의 해결 방안은 2018년 데미스 하사비스가 주도하는 구글 딥마인드 연구팀이 단백질 구조 예측 평가 대회인 ‘CASP’(Critical Assessment of Protein Structure Prediction)에 참가하면서 가시화되기 시작했다. 하사비스 연구팀은 인공지능 모델 ‘알파폴드’(AphaFold)를 통해 아미노산 서열을 토대로 단백질 구조 예측의 정확성을 획기적으로 높이는 결과를 선보였다. 이전 단백질 구조 예측의 정확도는 최고 40%였지만, 알파폴드는 60% 정확도를 나타내면서 과학계에 큰 충격을 안겼다. 이후 알파폴드의 응용성을 확장하고 정확도를 향상하기 위한 연구가 지속적으로 진행되면서 존 점퍼가 연구팀에 합류했고, 하사비스와 점퍼는 알파폴드2 개발을 주도했다. 3) 이들은 최신 인공지능 기술인 트랜스포머(Transformers)를 활용해 방대한 단백질 구조의 데이터셋 분석에 성공하면서 X선 결정학과 거의 유사한 정확도로 단백질 구조를 예측하는 데 성공했다.
3) Jumper, J., Evans, R., Pritzel, A., Green, T., Figurnov, M., Ronneberger, O., & Hassabis, D. (2021). Highly accurate protein structure prediction with AlphaFold. nature, 596(7873), 583-589.
그림 7 | 알파폴드2는 구조에서 아미노산이 얼마나 가까운지 추정하는 거리 지도를 생성한다.
구글 딥마인드는 2016년 우리나라의 이세돌 9단과 세기의 바둑 대국을 치른 인공지능 바둑 프로그램 알파고(AlphaGo)를 개발한 기업으로 잘 알려져 있다. 딥마인드는 알파폴드에 대해 다음과 같은 내용으로 자사 홈페이지에 소개하고 있다. “알파폴드는 수백만 개의 복잡한 3D 단백질 구조를 밝혀냈고, 생명체 분자가 어떻게 상호작용하는지에 대한 과학자들의 이해와 연구에 도움이 되고 있다. 지금까지 알파폴드는 2억 개가 넘는 단백질 구조를 예측했으며, 알파폴드 단백질 구조 데이터베이스와 서버는 과학 커뮤니티에 무료로 제공된다. 우리의 인공지능 시스템은 과학계의 오랜 도전 과제를 풀어 질병의 정복이나 일회용 플라스틱의 분해 등 인류에게 중요한 문제를 해결하는 데 조력하고 있다. 언젠가는 생물학적 세계에 대한 우리의 이해를 변화시키고 생명 그 자체의 미스터리를 밝히는 데에 도움이 될지도 모르겠다.” 이들은 2020년 업그레이드 버전인 알파폴드2를 발표한 이후 2021년 35만 개의 단백질 구조를 공개했고, 2022년에는 2억 개의 단백질 구조를 추가로 제공하는 등 단백질 구조 예측의 정확도를 60%에서 90%로 또다시 크게 끌어올렸다.
https://www.nobelprize.org
알파폴드2의 단백질 구조 예측 과정
알파폴드2의 단백질 구조 예측 과정은 크게 네 단계로 나눌 수 있다. 첫 번째 단계에서는 데이터 입력과 데이터베이스 검색 과정이 진행된다. 예를 들어 알파폴드2가 알 수 없는 아미노산 서열을 입력받으면 비슷한 서열 및 단백질 구조를 포함한 데이터베이스 검색으로 기초 정보를 확보한다. 다음 단계에서는 서열을 분석한다. 인공지능이 비슷한 서열들을 정렬하고 진화 과정에서 보존된 부분을 조사하게 되는데, 이 단계에서 보존된 아미노산은 단백질 기능과 밀접한 관계가 있다. 진화 과정에서 특정 아미노산 서열이 보존된다는 것은, 그 아미노산이 단백질 기능 수행에 중요하다는 것을 의미한다. 예를 들어 효소의 활성 부위에 있는 아미노산은 그 효소의 기질과 반응하는 데 필수적이다. 이 부위에 있는 아미노산이 변하면 효소의 작용이 저해되거나 완전히 상실될 수 있다. 또한 보존된 아미노산은 단백질의 구조적 안정성에도 도움을 준다. 특정 아미노산이 원래 위치에 남아 있을 때 단백질의 올바른 형태가 유지되고, 이를 통해 제 기능을 수행할 수 있기 때문이다. 따라서 보존된 아미노산 분석은 단백질의 구조와 기능을 이해하는 데 중요한 역할을 하며, 알파폴드2가 더 정확한 예측 결과를 산출할 수 있도록 돕는다. 이와 함께 서열 분석 단계에서는 아미노산 간 상호작용 분석도 진행된다. 전하를 띤 아미노산은 전기적으로 다른 아미노산과 상호작용한다. 예를 들어 특정 아미노산이 양전하를 띄고 있다면, 반대 전하인 음전하를 가진 아미노산과 서로 끌어당기게 된다. 이는 서로 다른 전하를 가진 것들이 가까워지려는 성질을 나타내며, 생체 내에서 단백질 구조와 기능에 영향을 미친다. 세 번째 단계에서는 인공지능 분석이 진행된다. 알파폴드2가 반복 과정을 통해 서열 분석과 거리 지도를 정제하는데, 이 과정에서 트랜스포머 신경망을 사용해 중요한 요소를 파악한다. 마지막 단계에서는 가설적 구조를 생성한다. 인공지능이 아미노산 조합을 바탕으로 단백질 구조의 가설을 세우고, 이 구조가 실제와 얼마나 일치하는지 평가한다. 이러한 과정을 여러 차례 반복하면서 모든 아미노산의 퍼즐을 맞추고 테스트 경로를 결합해 최종 구조를 도출하게 된다.
그림 8 | 알파폴드2는 반복 프로세스를 사용해 모든 아미노산의 퍼즐을 맞추고 테스트 경로를 결합해 가상의 단백질 구조를 생성한다.
알파폴드2는 현재 전 세계 190개국에서 200만 명 이상의 연구자들이 사용하고 있다. 연구자들이 몇 년 단위로 진행해야 했던 단백질 구조의 결정 과정은 알파폴드2를 거치면서 단 몇 분 내에 처리될 수 있게 되었다. 이에 따라 연구자들은 항생제 저항성에 대한 이해, 플라스틱 분해 효소의 이미지 생성 등 다양한 분야에서 알파폴드2를 활용하고 있다. 2024년 5월 구글 딥마인드와 아이소모픽 랩스(Isomorphic Labs) 공동연구팀은 알파폴드의 세 번째 버전을 공개했다. 이 버전은 단백질과 상호작용하는 다른 분자들에 대한 모델링 기능을 갖추고 있다. 단백질과 단백질 사이의 상호작용만 예측하던 기존의 알파폴드보다 한 단계 업그레이드된 것이다. 논문에서 연구팀은 알파폴드3가 단백질과 리간드 간 상호작용, 단백질과 핵산, 항체 등의 상호작용을 기존 버전보다 더 정확하게 예측할 수 있다고 설명하고 있다. 관련 분야의 전문가들은 리간드, 핵산, 항체 등 생체분자와 단백질의 상호작용에 대한 예측 정확도를 높일 수 있다면 질병 저항성 향상, 약물 설계 속도 개선 등 단백질을 활용한 신약 개발에 있어 도약과 발전의 전환점을 이끌어갈 것으로 전망한다.
https://www.nobelprize.org
새로운 단백질 설계를 통한 생명과학의 진보
하사비스와 점퍼가 이러한 단백질 구조 예측 연구에 집중하는 동안 베이커는 새로운 단백질을 만드는 도전과 혁신에 박차를 가했다. 베이커는 단백질 설계 분야에서 새로운 방향성을 제시했는데, 기존 단백질을 수정하는 대신 완전히 새로운 단백질을 설계하는 ‘de novo 설계’ 접근법에 초점을 맞추었다. 그는 1990년대부터 단백질 설계 관련 연구를 시작했는데, 아미노산 서열에서 단백질의 3차원 구조를 예측할 수 있는 ‘로제타’(Rosetta) 소프트웨어를 개발했다. 이 프로그램은 기존의 다양한 단백질 구조와 서열을 비교해 특정 형태로 접힐 수 있는 단백질 서열을 찾아내는 방식으로 작동한다. 예를 들어 새로운 단백질 구조를 설정하고 입력한 후 그에 맞는 아미노산 배열을 생성하는 역설계를 통해 원하는 단백질을 생성하는 개념이다. 베이커는 2003년 로제타 소프트웨어를 이용해 기존 단백질과 전혀 다른 단백질, 즉 93개 아미노산으로 구성된 새로운 단백질을 설계하고 합성하는 데 성공했다. 이러한 접근법은 단백질 연구 범위를 넓힐 뿐만 아니라, 새로운 기능을 가진 단백질을 설계할 수 있어 생명과학의 발전에 크게 기여할 수 있다.
그림 9 | 베이커의 로제타 프로그램을 사용해 개발된 단백질.
https://www.nobelprize.org
이후 베이커는 자연에 없는 반응을 촉매하는 새로운 단백질 설계 등 지속적으로 새롭고 창의적인 단백질을 개발하면서 백신 등 의약 관련 제품, 나노 소재, 미세 센서 등 다양한 생명과학 영역에서의 혁신을 주도하고 있다. 노벨 화학상 위원회 의장 하이너 링케(Heiner Linke)는 단백질 구조 예측과 새로운 단백질 설계 연구가 인류에게 큰 혜택을 가져올 것이라고 강조했다. 단백질의 구조를 예측하고 자신만의 새로운 단백질을 설계할 수 있는 길이 열리면서 인류의 건강 증진, 환경 문제 해결 등 생명과학 분야에서 무궁무진한 가능성의 시대가 펼쳐질 것으로 전망된다.
그림 10 | 구글 딥마인드 하사비스와 점퍼의 알파폴드2를 사용해 결정된 단백질 구조.
한편 베이커 역시 노벨물리학상 수상자인 제프리 힌턴이 주장하는 인공지능 진화의 위험과 우려에 대한 시각을 공개적으로 밝힌 바 있다. 그는 2024년 3월 전 세계 유수의 생물학자들, 인공지능 연구자들과 함께 ‘책임감 있는 AI X 바이오디자인’(Responsible AI x Biodesign) 성명에 서명했다. 총 10개 조항으로 구성된 성명에는 ‘연구의 이점과 위험에 대한 소통’, ‘사회적 이익을 위한 연구 수행’, ‘위험한 생체분자를 제조하기 전 새로운 전략 개발’, ‘오용을 조장할 가능성이 있는 연구 금지’ 등 인공지능 기술이 접목된 바이오 연구의 위험 가능성과 우려를 최소화하기 위한 내용이 포함되어 있다. 전문가들은 이번 노벨화학상 선정 결과에 대해 인공지능과 생명과학의 융합이 인류에 미치는 영향, 그리고 이러한 연구의 시너지 효과가 얼마나 막대한지 다시 한번 주목하게 해주는 중요 사건이라고 강조한다. 인공지능 기술이 방대한 양의 데이터를 분석하고 패턴을 인식하는 데 강력한 도구로 작용하면서 단백질의 구조와 기능에 대한 이해를 빠르고 효율적으로 높이고 더 나아가 생명 그 자체의 미스터리를 밝히려는 연구에 크게 기여하고 있다는 것이다.
https://www.nobelprize.org
인간과 인공지능이 함께하는 과학 발전의 새로운 지평
종합해 보면, 2024년 노벨물리학상과 노벨화학상은 단순히 인공지능 연구자들에게 주어진 상이 아니라, 인공지능이 과학 연구의 중요한 도구로 인정받았고 향후 과학 연구의 주역으로 더욱 굳건히 자리 잡아야 함을 알리는 서막이라고 할 수 있다. 인공지능 분야의 연구와 연구자들이 2024 노벨상의 주요 이슈와 키워드로 떠오른 만큼 인공지능 기술에 대한 과학자들의 신뢰와 활용도는 더욱 커질 것으로 전망된다. 역사적으로 노벨상이 기초 학문 자체의 발전뿐만 아니라 사회 연구와 그 영향력에 주목해 왔던 것처럼, 과학 연구에서도 학문 간 융합 연구는 물론 기술 발전의 사회적 책임과 영향에 대해 더욱 진지한 고민이 필요한 시점이다. 전문가들은 머지않은 미래에 인공지능이 유능한 과학자이자 연구 동료로 자리매김하면서 연구의 중심에 서게 될 것으로 예측한다. 네이처가 한 해의 중요 인물을 선정·발표하는 ‘Nature’s 10’에 2023년 처음으로 사람이 아닌 ‘인공지능 챗GPT’를 특별 수상자로 선정한 것처럼, 언젠가 노벨위원회는 인공지능 그 자체를 노벨상 수상자로 선택할 가능성도 있어 보인다. 특히 물리학, 생물학, 화학 등 학문 간 경계가 흐려지면서 연구자들은 복잡한 난제를 해결하기 위해 인공지능 기술을 포함한 다학제 연구를 활발하게 진행하고 있다. 과학과 기술의 융합과 발전, 과학기술 사회의 협력과 통합은 더 이상 새롭거나 주목받는 이슈가 아니다. 인공지능 기술의 적용은 연구자들이 다양한 분야를 통합하고 협력하면서 새로운 발견을 이루는 데 더욱 주요하게 작용할 것이다. 하지만 인공지능 기술에 대한 맹목적 기대와 신뢰는 과학 연구의 질을 저하하거나 과학적 발견이 사회에 미치는 영향 등을 등한시하게 될 위험을 초래할 수 있다. 실제로 하사비스는 인공지능 기술이 공학적으로 진화하고 있다고 언급하면서 연구자들이 특정 분야에 대한 깊은 이해 없이 인공지능 기술을 적용하게 될 수 있다고 경고했다. 인공지능 기술 활용이 연구 효율성을 높이는 데만 집중된다면, 연구자들이 새로운 이론을 발전시키거나 과학적 사고를 배양하는 과정에서 인공지능은 오히려 걸림돌로 작용할 수 있다는 의미이다. 결국 인공지능 발전은 과학 연구의 새로운 지평을 열 수 있겠지만, 연구자들이 적절하게 대응하지 못한다면 잘못된 방향으로 나아갈 수 있음을 주의 깊게 경계해야 할 것이다. 인간과 인공지능의 협력에 따른 결과물이 어떤 가치와 의미를 창출할지 과학의 본질과 방향성, 과학 연구의 질과 기준, 인공지능 진화가 불러올 사회적·윤리적 문제와 영향 등에 대한 사회적 논의가 활발해질 때 새로운 변화의 물결을 반영한 진정한 혁신이 이루어질 수 있다. 이번 노벨상 결과는 이러한 논의를 확대할 수 있는 중요한 출발점이 되지 않을까.
KOSAC
KOSAC ISSUE PAPER는 과학기술, 과학문화, 과학융합인재, 과학·수학교육, SW/AI 분야의 주요 이슈를 심층 분석하고 정책 제언을 함으로써, 미래 이슈에 선제적으로 대응하고자 발행하고 있습니다.
※ 본 보고서의 내용은 저자 개인의 의견을 정리한 것으로 한국과학창의재단의 공식 견해와 다를 수 있음을 밝힙니다.
정책기획실 (06130)서울특별시 강남구 테헤란로7길 22, 4~5층(역삼동, 과학기술회관 2관) 기타 추가의견, 정책 제언 등 관련 문의 접수 ㅣe-mail sns@kosac.re.kr
글이 없거나 같은 내용이 반복되는 쪽은 뺐습니다. 이북으로 보기