
대학원 과목중 " 의생명과학을위한 AI" 수업을 재밌게 들어서 DNA + AI 분야에 관심이 생겼다.
그래서 Genome Foundation Model(DNA LLM) 분야를 처음 공부하는 `나` 같은 사람을 위한 논문 읽기 로드 맵이다.
이 중에 몇개는 이미 읽었지만 그래도 기록용으로 순서를 남긴다
1. Attention Is All You Need (2017)
Transformer를 처음 제안한 논문으로, RNN과 LSTM 없이 Self-Attention만으로 자연어를 효과적으로 처리할 수 있음을 보여주었다. 현재 GPT, BERT, DNABERT 등 대부분의 대규모 언어 모델의 기반이 되는 연구이다.
- Transformer 아키텍처
- Self-Attention
- Multi-Head Attention
- Positional Encoding
- Encoder / Decoder 구조
- 기존 RNN, LSTM과의 차이
- 병렬 처리와 긴 문장 처리의 장점
해당 포스트 → https://podo1017.tistory.com/509
2. BERT (2018)
- BERT: Pre-training of Deep Bidirectional Transformers for Language Understanding
Transformer의 Encoder를 기반으로 한 사전학습(Pre-training) 언어 모델이다. 양방향 문맥을 동시에 학습하는 방법을 제안했으며, 이후 다양한 NLP 모델의 기반이 되었다. DNABERT 역시 BERT 구조를 DNA 데이터에 적용한 모델이다.
- Bidirectional Learning
- Masked Language Modeling (MLM)
- Next Sentence Prediction (NSP)
- Pre-training & Fine-tuning
- Transformer Encoder 활용 방법
- 다양한 자연어 처리 태스크 적용
3. DNABERT (2021)
- DNABERT: Pre-trained Bidirectional Encoder Representations from Transformers Model for DNA-Language in Genome
DNA 서열을 하나의 언어(Language)처럼 해석하여 BERT를 적용한 최초의 대표적인 Genome Language Model이다. DNA를 k-mer 단위로 토큰화하여 다양한 유전체 분석 작업에 활용하였다.
- DNA를 Language처럼 해석하는 방법
- k-mer Tokenization
- DNA용 Masked Language Modeling
- Promoter Prediction
- Splice Site Prediction
- TF Binding Site Prediction
- Genome Foundation Model의 시작
4. DNABERT-2 (2024)
- DNABERT-2: Efficient Foundation Model and Benchmark for Multi-Species Genomes
DNABERT를 개선한 모델로, 기존 k-mer 대신 BPE(Byte Pair Encoding)를 적용하여 더 효율적으로 다양한 생물 종의 DNA를 학습할 수 있도록 발전시킨 모델이다.
- BPE Tokenization
- Multi-Species Learning
- Genome Foundation Model
- GUE Benchmark
- 기존 DNABERT와의 성능 비교
- 효율적인 DNA 표현 학습
5. Genomic Language Models: Opportunities and Challenges (2025)
- Genomic Language Models: Opportunities and Challenges
Genome Language Model 분야의 발전 과정과 현재 연구 동향을 정리한 리뷰 논문이다. 주요 모델과 활용 사례, 앞으로의 연구 과제를 한 번에 이해할 수 있다.
- Genome Language Model 개요
- DNABERT 계열 소개
- Nucleotide Transformer
- HyenaDNA
- 활용 분야
- 현재 한계점
- 향후 연구 방향
6. The DNA Dialect: A Comprehensive Guide to Pretrained Genomic Language Models (2026)
- The DNA Dialect: A Comprehensive Guide to Pretrained Genomic Language Models
사전학습 기반 Genome Language Model을 종합적으로 정리한 최신 리뷰 논문이다. 모델 구조부터 학습 방법, 활용 사례까지 전체 흐름을 이해하는 데 적합하다.
- Genome LLM 역사
- Transformer 기반 모델 비교
- Tokenization 기법
- 학습 데이터 구성
- Foundation Model 구조
- Fine-tuning 방법
- Variant Prediction
- 모델별 장단점 비교
7. Benchmarking DNA Foundation Models (2025)
- Benchmarking DNA Foundation Models
대표적인 DNA Foundation Model들을 동일한 환경에서 비교·평가한 논문이다. 각 모델의 강점과 약점을 분석하여 어떤 작업에 어떤 모델이 적합한지 보여준다.
- DNABERT-2
- HyenaDNA
- Caduceus
- Nucleotide Transformer
- GROVER
- 모델 성능 비교
- 태스크별 장단점 분석
8. Evo 2 (2026)
- Genome modeling and design across all domains of life with Evo 2
초대규모 Genome Foundation Model로, 방대한 DNA 데이터를 학습하여 유전자 변이 예측, DNA 생성 등 다양한 생물학적 문제를 해결하기 위해 개발된 최신 모델이다.
- 초대규모 Genome 학습
- Long Context 처리
- DNA 생성(Generation)
- Mutation Prediction
- Genome Foundation Model 최신 동향
- 대규모 생물학 데이터 활용
앞으로 각 논문를 읽으면서 내용을 정리하여 블로그 포스팅을 할 예정이다.
댓글