본문 바로가기
HOME> 논문 > 논문 검색상세

논문 상세정보

Biomolecules v.8 no.1, 2018년, pp.12 -    SCIE
본 등재정보는 저널의 등재정보를 참고하여 보여주는 베타서비스로 정확한 논문의 등재여부는 등재기관에 확인하시기 바랍니다.

The Impact of Protein Structure and Sequence Similarity on the Accuracy of Machine-Learning Scoring Functions for Binding Affinity Prediction

Li, Hongjian    (SDIVF R&D Centre, Hong Kong Science Park, Sha Tin, New Territories, Hong Kong, China  ); Peng, Jiangjun    (jackyleehongjian@gmail.com   ); Leung, Yee    (Institute of Future Cities, The Chinese University of Hong Kong, Sha Tin, New Territories, Hong Kong, China  ); Leung, Kwong-Sak    (andrew.pengjj@gmail.com (J.P.)  ); Wong, Man-Hon    (yeeleung@cuhk.edu.hk (Y.L.)  ); Lu, Gang    (ksleung@cse.cuhk.edu.hk (K.-S.L.)   ); Ballester, Pedro J.    (Institute of Future Cities, The Chinese University of Hong Kong, Sha Tin, New Territories, Hong Kong, China  );
  • 초록  

    It has recently been claimed that the outstanding performance of machine-learning scoring functions (SFs) is exclusively due to the presence of training complexes with highly similar proteins to those in the test set. Here, we revisit this question using 24 similarity-based training sets, a widely used test set, and four SFs. Three of these SFs employ machine learning instead of the classical linear regression approach of the fourth SF (X-Score which has the best test set performance out of 16 classical SFs). We have found that random forest (RF)-based RF-Score-v3 outperforms X-Score even when 68% of the most similar proteins are removed from the training set. In addition, unlike X-Score, RF-Score-v3 is able to keep learning with an increasing training set size, becoming substantially more predictive than X-Score when the full 1105 complexes are used for training. These results show that machine-learning SFs owe a substantial part of their performance to training on complexes with dissimilar proteins to those in the test set, against what has been previously concluded using the same data. Given that a growing amount of structural and interaction data will be available from academic and industrial sources, this performance gap between machine-learning SFs and classical SFs is expected to enlarge in the future.


  • 주제어

    machine learning .   scoring function .   molecular docking .   binding affinity prediction.  

 활용도 분석

  • 상세보기

    amChart 영역
  • 원문보기

    amChart 영역

원문보기

무료다운로드
유료다운로드
  • 원문이 없습니다.

유료 다운로드의 경우 해당 사이트의 정책에 따라 신규 회원가입, 로그인, 유료 구매 등이 필요할 수 있습니다. 해당 사이트에서 발생하는 귀하의 모든 정보활동은 NDSL의 서비스 정책과 무관합니다.

원문복사신청을 하시면, 일부 해외 인쇄학술지의 경우 외국학술지지원센터(FRIC)에서
무료 원문복사 서비스를 제공합니다.

NDSL에서는 해당 원문을 복사서비스하고 있습니다. 위의 원문복사신청 또는 장바구니 담기를 통하여 원문복사서비스 이용이 가능합니다.

이 논문과 함께 출판된 논문 + 더보기