최신 AI 연구, 어디로 향하고 있나? 해외 논문 1,000편으로 본 AI 핵심 키워드와 주요 토픽
Section 1. AI 논문에서 핵심 키워드는 무엇일까?
※ 데이터 분석 전, 먼저 살펴봐야 할 수집 단계의 준비 과정:
☞ '최신 AI 연구, 어디로 향하고 있나? 해외 논문 1,000편으로 본 핵심 연구자 분석'
A. 단어의 빈도 수/TF-IDF 값 확인하기
지난 시간과 마찬가지로 Word Statistics 에서 단어의 빈도 수와 TF-IDF 값을 확인하도록 하겠습니다. 이번에는 사용자 사전까지 적용한 결과를 살펴보도록 하겠습니다.
텍스트(Text) > 단어 통계(Word Statistics)를 선택합니다.
Input 컨트롤 아이템에서 방금 가져온 데이터 아이템과 텍스트가 포함된 속성(Attribute)을 선택합니다.
Main Process 에서 분석할 텍스트의 언어(Language)와 추출할 품사(Part of Speech)를 선택합니다(예: English, Common Noun, Proper Noun).
User Dictionary 에서 전처리에 적용할 사용자 사전 칼럼을 선택합니다.
사용자 사전에 대한 자세한 설명은 NetMiner 5 매뉴얼의 '문서 필터링 및 사전 선택하기' 를 참고하세요.
Run Process 버튼을 클릭하여 수행합니다.

[T]Words 탭에서 Total Frequency 또는 Average TF-IDF 칼럼을 클릭하면 빈도 수 또는 평균 TF-IDF를 내림차순/오름차순으로 확인할 수 있습니다.
Total Frequency |
Average TF-IDF |
논문 1,000편을 분석한 결과, 가장 많이 사용된 단어는 'study', 'application', 'Machine Learning', 'challenge', 'education', 'potential', 'Healthcare', 'literature', 'Chatgpt', 'patient' 등이었습니다.
한편, 평균 TF-IDF 기준으로 가장 중요한 단어로는 'Neuro', 'Society', 'biofuel', 'illusion', 'cryptography', 'TCIM', 'SRS', 'geoscience', 'Drug Discovery and Development', 'nanogenerator', 'greenwashing', 'Endodontic', 'Brain', 'biosensing' 등이 나타났습니다.
단어 빈도 수를 정렬한 결과를 확인했을 때는 주로, 인공지능(AI) 관련 기술과 관련된 단어들이 나타난 반면, TF-IDF 값을 정렬한 결과에서는 인공지능 기술을 활용한 것으로 추정되는 학문 분야와 관련된 단어들이 나타난 것을 확인할 수 있었습니다.
하단의 Add To Dataset> Text Network Items를 클릭하고 OK 버튼을 클릭하시면 전처리가 완료된 새로운 노드셋과 네트워크가 좌측 패널에 나타나는 것을 확인하실 수 있습니다.
Section 2. 해외 연구자들이 관심을 갖는 AI 연구 주제는?
인공지능(AI)이 LDA 토픽 모델링을 통해 해외에서 인공지능(AI)과 관련해 어떤 주제의 연구 논문들이 작성되었는지 살펴보겠습니다.
A. 토픽 모델 평가(Topic Evaluation)
토픽모델링을 수행하기 앞서 가장 적절한 토픽의 개수는 몇 개인지부터 확인을 해야 합니다.
텍스트(Text) > 토픽(Topic) > 토픽 모델 평가(Topic Evaluation)
오른쪽 Input 패널에서 분석에 사용할 Documents 데이터셋과 텍스트가 포함된 Text 칼럼을 선택합니다.
분석에 적용할 언어와 품사를 선택합니다.
사용자 사전을 등록합니다.
단어 필터링(Word Filtering) 조건을 입력합니다.
3글자 이상의 단어, 사용 빈도가 3회 이상, TF-IDF 값이 0.2 이상인 단어들로 필터링을 하겠습니다.

파라미터 값을 설정합니다.
Measure: Coherence 계산 방식(c_v, u_mass)을 선택합니다.
# of Topics (K): 토픽 수의 범위를 지정합니다.
alpha (α): 문서 내 토픽 분포의 확률 값 범위를 입력합니다.
eta (β): 주제 별 단어 분포에 대한 사전 확률 분포 값 범위를 설정합니다.
# of Iterations: 각 LDA 모델 실행 시 반복 횟수를 지정합니다.

Run Process 버튼을 클릭하면 가장 적절한 토픽 수와 alpha, eta 값이 도출된 것을 확인하실 수 있습니다.
Topic Evaluation 결과 3개의 토픽, alpha와 eta 값은 0.01이 가장 적절한 파라미터 값으로 판단했습니다.

B. LDA 토픽 모델링
텍스트(Text) > 토픽(Topic) > LDA
토픽 모델 평가(Topic Evaluation)와 마찬가지로 분석에 사용할 Documents 데이터셋과 텍스트가 포함된 Text 칼럼, 분석에 적용할 언어와 품사, 사용자 사전 등록, 단어 필터링(Word Filtering) 조건을 지정합니다.
파라미터 입력 값은 Topic Evaluation 에서 도출된 값을 입력합니다.

토픽 모델링 분석 결과가 도출되었습니다.

Section 3. AI 연구 키워드는 어떻게 연결되어 있을까?
논문에 사용된 단어들 간의 연결 관계를 살펴보기 위해서 공출현 단어 네트워크를 생성하고 이를 시각화로 나타내보도록 하겠습니다.
공출현 단어 네트워크 분석은 논문 텍스트(예: 제목, 초록 등)에서 같이 등장한 단어들 간의 관계를 분석함으로써, 주요 연구 분야나 세부 주제가 무엇인지, 특정 개념이 어떤 다른 개념들과 연결되어 있는지, 어떤 단어가 네트워크 중심에 위치하는지, 신흥 연구 주제 또는 다학제 융합 흐름을 발견할 수 있습니다.
A. Work Network
단어의 공출현 네트워크를 생성하는 방법은 2가지가 있습니다. 단어 간의 거리에 기반한 (Sliding Window) 방식과 동시출현(Co-occurence) 방식이 있습니다. 이번 시간에는 단어 간의 거리에 기반한(Sliding Window) 공출현 단어 네트워크를 생성하여 분석을 진행하도록 하겠습니다.
전처리(Pre-process) > 텍스트(Text) > Word Network > 슬라이딩 윈도우(Sliding Window)
분석에 사용할 Documents 데이터셋과 텍스트가 포함된 Text 칼럼, 분석에 적용할 언어와 품사, 사용자 사전을 등록합니다.
widow size: 단어 간 링크 생성 범위를 설정 시 포함되는 단어의 개수
Link Frequency Threshold: 공동 등장 횟수의 임계값
Direction(Directed / Un-Directed): 링크의 방향성 여부
파라미터 값을 지정합니다.

[T]Word Network에서 단어의 공출현 네트워크를 Edge List 형태로 확인할 수 있습니다.
결과표 오른쪽 아래의 Add To Dataset > Text Network Items 버튼을 클릭하세요.

Word와 Word Network가 선택된 것을 확인하고 OK 버튼을 누릅니다. 이제 단어와 단어의 공출현 네트워크가 새로운 노드셋과 네트워크로 추가되었습니다.
B. 불필요한 단어 필터링하기
고립된 단어 노드를 분석에서 제외하기 위해 전처리 작업이 필요합니다.
네트워크(Network) > 이웃(Neightbor) > 연결 차수(Degree)
1-mode Network에 Word Network와 Use Weight를 선택 후 Run Process 클릭하세요.
[T]Node Type 탭에서 Add To Dataset > Node Attribute를 클릭하세요.
Node Type이 선택된 것을 확인하고 OK 버튼을 누릅니다. 이제 Node Type이 Word 노드셋의 새로운 속성으로 추가되었습니다.

Node Type 이 "isolate" 인 단어는 다른 단어와 연결 관계가 없는 고립된 노드셋을 의미합니다. 따라서, 분석에 불필요하기 때문에 Query 를 이용하여 제외하도록 하겠습니다.
Tools > Query
Select Dataset 에서 Word 노드셋을 선택하고 고립 노드인 단어 뿐만 아니라 단어의 길이와 사용 빈도 횟수가 3이상인 단어들만 필터링하겠습니다.

5,987개의 단어 중 1,729개의 단어들로 필터링 되었습니다.
Apply Result 버튼을 클릭하여 새로운 워크스페이스에 노드셋과 네트워크를 생성합니다.
C. 중심성 분석 결과를 단어 노드셋의 속성으로 추가
네트워크(Network) > 중심성(Centrality) > 연결중심성(Degree Centrality)를 실행합니다.
오른쪽 Input 컨트롤 패널에서 단어 네트워크를 선택하고 Use Weight를 체크한 다음, Run Process 버튼을 클릭합니다.
[T]Degree Centrality에서 Add to Dataset > Node Attribute 버튼을 클릭하세요.
In-Degree Centrality와 Out-Degree Centrality가 모두 선택된 것을 확인하고 OK 버튼을 누릅니다. 이제 중심성 값이 노드셋의 새로운 속성으로 추가되었습니다.
D. Word Network 시각화하기
시각화(Visualize) > 네트워크(Network) > 1-모드(1-mode)를 실행합니다.
오른쪽 컨트롤 패널에서 스타일(Style) 탭을 클릭합니다.
노드 크기(Size) 조절: Node 탭에서 Size 항목의 오른쪽의 크기 아이콘을 클릭합니다. 방금 추가한 In-Degree Centrality를 선택하면, 중심성이 높은 노드가 즉시 커지는 것을 볼 수 있습니다.
링크 두께(Width) 조절: Link 탭에서 Width 항목의 오른쪽 선 아이콘을 클릭합니다. WEIGHT를 선택하면, 링크의 두께를 가중치가 클수록 두꺼워지는 것을 볼 수 있습니다.
즉, 중심성이 높은 단어 노드의 크기는 커지고 중심성이 낮은 단어 노드의 크기는 작아지는 것을 시각적으로 확인함으로써 AI 연구 흐름 속에서의 개념적 맥락과 연구 주제 간 연결고리 역할을 하는 핵심 단어가 무엇인지 확인할 수 있고, 및 단어 간의 연결 관계를 식별할 수 있게 되었습니다.
또한, 단어 간의 동시출현 빈도가 높을수록 링크가 지는 것을 통해서 두 단어가 AI 연구 내에서 서로 밀접한 관계에 있으며 하나의 주제나 문맥 안에서 자주 함께 다뤄지는 중요한 개념쌍이라는 인사이트를 얻을 수 있게 되었습니다.

Section 4. 복잡한 분석 결과, AI Assistant가 말해주는 핵심 요약!
지금까지 단어 네트워크 분석한 결과를 AI는 어떻게 바라보는지 AI Assistant를 통해 확인하도록 하겠습니다.
A. 토픽 모델링 분석 결과 해석

AI 는 '헬스케어', '교육', '의료' 분야에서 인공지능과 관련된 연구가 활발하게 이뤄지고 있다고 판단했습니다.
Topic1은 헬스케어 분야와 관련된 논문들로 분류할 수 있고, 특히 머신러닝 기술이 헬스 케어 산업에서 응용되고 있고 개발과정에서 직면하는 도전 과제, 잠재력, 통합 방안 및 의사결정 지원 솔루션에 대한 논의가 이뤄지고 있다고 해석했습니다.
Topic2는 교육분야와 관련된 논문들로 분류할 수 있고, 특히 ChatGPT와 같은 생성형 AI가 교육 환경에서 어떻게 적용 가능한지, 잠재적으로 어떤 영향을 미칠지에 대한 논의가 이뤄지고 있다고 해석했습니다.
Topic3는 의학분야와 관련된 논문들로 분류할 수 있고, 특히 질병 진단, 신약 개발, 환자 치료 등 의료 분야에서 머신러닝 기술이 구체적으로 어떻게 적용될 수 있는지에 대한 응용 사례 및 연구에 초점을 맞추고 있다는 것을 알 수 있다고 해석했습니다.
B. 연결 중심성 분석 결과 해석

연결 중심성 분석 결과, AI는 Healthcare(헬스케어), Machine Learning(머신러닝), education(교육)과 같은 특정 응용 분야와 핵심 기술 키워드가 높은 중심성을 나타냈습니다.
이는, 해당 분야와 기술이 인공지능 연구에서 중요한 관심사이자 활발한 연구 주제임을 시사합니다.
또한 detection(탐지), diagonos(진단), Deep Learning(딥러닝) 같은 세부 기술을 나타내는 단어도 높은 중심성을 보여, 딥러닝이 탐지 또는 진단 영역에서 활발히 활용되고 있음을 알 수 있었습니다.
이 밖에도 커뮤니티 탐지와 다양한 중심성 지표를 적용한 분석 방법론을 제시해 연구자들이 추가적인 인사이트를 얻을 수 있도록 안내하고 있습니다.
NetMiner 5와 Biblio Data Collector를 활용하여, 논문 서지 데이터를 수집하고, 분석하고, 시각화하고, AI를 활용하는 연구 동향 분석 과정이 끝났습니다.
이제 NetMiner 5로 당신의 데이터를 새로운 시각으로 분석해 보세요!
※ 관련 튜토리얼



