순서가 있습니다. 포털 넷(연구방·지식센터·커뮤니티·아카데미)을 먼저 담고,
SSRA 는 맨 나중에 담아 주세요. SSRA 를 먼저 담으면 나머지가 그 안에 포함된 것으로
잡혀 따로 담기지 않습니다. 아이콘도 담을 차례대로 놓았습니다 — 왼쪽부터 차례로 누르시면 됩니다.
Bilingual language model for protein sequence and structure
Michael Heinzinger, Konstantin Weißenow, Joaquín Gómez Sánchez 외 · NAR Genomics and Bioinformatics · 2024년 · 조회 13
왜 이 논문인가 — 선정 기준
RESEARCH PAPER · 후속 연구설계에 활용하기 좋은 논문 — 척도·모형·프레임워크류, 피인용 다수
2024-09 발표 · 피인용 234회 · FWCI 34.3 · 동년 인용 상위 1% · 참고문헌 105개
RESEARCH PAPER 슬롯은 후속 연구 설계에 활용도가 높은 논문을 선정하며, 2024년 발표 이후 234회 인용·FWCI 34.3으로 상위 1%에 해당한다.
논문 요약
단백질 서열과 3차원 구조를 동시에 모델링하기 위해 기존 단백질 언어 모델을 확장하였다. 구조는 Foldseek의 3Di 알파벳을 이용해 토큰 시퀀스로 인코딩하고, AlphaFoldDB 기반의 비중복 데이터셋을 구축하였다. 기존 pLM인 ProtT5를 미세조정해 3Di와 아미노산 서열 사이의 변환을 학습시켰으며, 제안된 ProstT5 모델은 후속 작업에서 성능 향상을 보였다.
후속 연구설계에 활용하기
ProstT5를 사전학습 모델로 사용해 구조‑서열 번역 태스크를 추가함으로써, 기능 예측·변이 효과 분석 등 후속 연구에서 구조 정보를 반영한 임베딩을 생성할 수 있다.
핵심어
단백질 언어 모델3Di 알파벳ProstT5AlphaFoldDB
실존 확인
이 논문은 OpenAlex에서 후보로 수집한 뒤, Crossref에 등록된 DOI와 제목 일치를 확인해 노출합니다.
SSRA가 문헌연구에서 인용 논문의 실재 여부를 검증하는 원칙과 같습니다.