슈퍼 패밀리 데이터베이스

Superfamily database
슈퍼 패밀리
내용
묘사SUPERFAILY 데이터베이스는 모든 단백질과 게놈에 대한 구조적이고 기능적인 주석을 제공한다.
데이터형
발동.
단백질 패밀리, 게놈 주석, 정렬, 숨겨진 마르코프 모델(HM)
유기체모든.
연락
연구소브리스톨 대학교
실험실.
주요 인용문PMID 19036790
접근
data 형식FASTA 포맷
웹 사이트supfam.org
다운로드 URLsupfam.org/SUPERFAMILY/downloads.html
여러가지 종류의
면허증.GNU 일반 공중 라이선스
버전1.75

SUPER FAMILY는 모든 단백질 및 [1][2][3][4][5][6][7]게놈에 대한 구조 및 기능 주석 데이터베이스 및 검색 플랫폼입니다.아미노산 배열을 알려진 구조적 영역, 특히 SCOP [8][9]수퍼패밀리로 분류한다.도메인은 단백질을 형성하는 기능적, 구조적, 그리고 진화적 단위이다.공통 조상의 도메인은 슈퍼 패밀리로 분류됩니다.도메인 및 도메인 슈퍼패밀리는 SCOP에서 [8][10]정의 및 설명됩니다.슈퍼패밀리는 공통된 진화적 조상을 뒷받침하는 구조적 증거를 가지고 있지만 감지 가능한 배열 상동성[11]가지고 있지 않을 수 있는 단백질의 그룹이다.

주석

SUPERFAILY 주석은 SCOP 슈퍼 패밀리 [12]수준에서 구조 단백질 도메인을 나타내는 숨겨진 마르코프 모델(HMM)의 모음을 기반으로 한다.[13] 슈퍼 패밀리는 진화적 관계를 가진 도메인을 함께 그룹화합니다.주석은 완전히 배열된 게놈에서 숨겨진 마르코프 모델에 대한 단백질 서열을 스캔함으로써 생성됩니다.

각 단백질에 대해 다음을 수행할 수 있습니다.

  • SCOP 분류를 위한 시퀀스 전송
  • 도메인 구성, 배열 정렬 및 단백질 배열 세부 정보 보기

각 게놈에 대해 다음을 수행할 수 있습니다.

  • 슈퍼패밀리 할당, 계통수, 도메인 조직 목록 및 네트워크를 조사합니다.
  • 게놈 내에서 슈퍼패밀리와 슈퍼패밀리가 과다하게 표현되지 않았는지 확인합니다.

각 슈퍼 패밀리에 대해 다음을 수행할 수 있습니다.

  • SCOP 분류, 기능 주석, Gene Ontology 주석,[6][14] InterPro 추상 및 게놈 할당 검사
  • 트리 오브 라이프에 걸친 슈퍼패밀리의 분류학적 분포 조사

모든 주석, 모델 및 데이터베이스 덤프는 누구나 자유롭게 다운로드할 수 있습니다.

특징들

시퀀스 검색

SUPERFAILY HMM을 사용하여 SCOP 슈퍼패밀리와 패밀리레벨 분류를 위해 단백질 또는 DNA 시퀀스를 제출합니다.시퀀스는 원시 입력 또는 파일 업로드로 제출할 수 있지만 모두 FASTA 형식이어야 합니다.배열은 아미노산, 고정 프레임 뉴클레오티드 배열 또는 제출된 뉴클레오티드 배열의 모든 프레임일 수 있습니다.한 번에 최대 1000개의 시퀀스를 실행할 수 있습니다.

키워드 검색

슈퍼 패밀리, 패밀리 또는 종 이름과 시퀀스, SCOP, PDB 또는 HMM ID를 사용하여 데이터베이스를 검색합니다.검색이 성공하면 쿼리에 일치하는 클래스, 접힘, 슈퍼 패밀리, 패밀리 및 개별 단백질이 생성됩니다.

도메인 할당

데이터베이스는 완전한 진핵생물 및 원핵생물 배열과 배열 수집을 위한 도메인 할당, 정렬 및 아키텍처를 가지고 있습니다.

Genomics 비교 도구

각 유기체에 대해 특이한(과잉 및 불충분한) 슈퍼패밀리와 패밀리, 인접 도메인 쌍 목록과 그래프, 고유한 도메인 쌍, 도메인 결합, 도메인 아키텍처 공존 네트워크 및 분류학적 왕국 전체에 걸친 도메인 분포를 탐색한다.

게놈 통계

각 게놈: 시퀀스 수, 할당된 시퀀스 수, 할당된 시퀀스 비율, 총 시퀀스 범위 비율, 할당된 도메인 수, 할당된 슈퍼 패밀리 수, 할당된 패밀리 수, 할당된 평균 슈퍼 패밀리 크기, 복제에 의해 생성된 비율, 평균 시퀀스 길이, 평균 길이 일치ed, 도메인 쌍의 수 및 고유 도메인 아키텍처의 수.

진 온톨로지

도메인 중심의 GO(Gene Ontology)가 자동으로 주석을 달았다.

배열된 단백질과 단백질의 알려진 기능 사이의 격차가 커짐에 따라, 특히 알려진 도메인을 가진 단백질에 기능적으로 주석을 다는 보다 자동화된 방법을 개발하는 것이 점점 더 중요해지고 있다.SUPERFAILY는 GOA(Genome Ontology Annotation) 프로젝트에서 가져온 단백질 수준의 GO 주석을 사용합니다.GOA는 광범위한 [15]종에 걸쳐 UniprotKB의 단백질과 직접 연관된 고품질 GO 주석을 제공합니다.SUPERFAILY는 진화적으로 닫힌 도메인(SCOP 패밀리 레벨)과 원격 도메인(SCOP 슈퍼 패밀리 레벨)에 대한 GO 주석을 생성했다.

표현형 온톨로지

질병 온톨로지, 인간 표현형, 마우스 표현형, 웜 표현형, 효모 표현형, 파리 표현형, 파리 해부학, 제브라피시 해부학, 제노푸스 해부학 및 아라비도시스 식물을 포함하는 도메인 중심 표현형/해부학 온톨로지.

슈퍼패밀리 주석

InterPro는 1,000개 이상의 슈퍼패밀리를 추상화하고 700개 이상의 슈퍼패밀리를 GO(Gene Ontology) 주석을 추상화합니다.이 기능을 사용하면 슈퍼 패밀리의 주요 특징, 기능 및 구조에 직접 주석을 달 수 있습니다.

기능 주석

SCOP 1.73 슈퍼 패밀리의 기능 주석.

SUPERFAILY 데이터베이스는 COG [16]데이터베이스에서 사용되는 체계와 유사하게 7개의 일반 기능 범주에 매핑되는 50개의 세부 기능 범주의 체계를 사용합니다.슈퍼패밀리에 할당된 일반 함수는 슈퍼패밀리의 주요 함수를 반영하기 위해 사용되었습니다.기능의 일반적인 카테고리는 다음과 같습니다.

  1. 정보: 저장, 유전자 코드 유지, DNA 복제 및 복구, 일반 전사번역.
  2. 규정:유전자 발현 및 단백질 활성 조절, 환경 입력에 대한 정보 처리, 신호 전달, 일반적인 조절 또는 수용체 활성.
  3. 대사:동화 작용과 이화 작용, 세포 유지와 항상성, 2차 대사.
  4. 세포내 과정: 세포운동성과 분열, 세포사망, 세포내 수송, 분비.
  5. 세포외 과정: 세포접착과 같은 세포간, 세포외 과정; 혈액응고나 면역체계와 같은 유기적 과정.
  6. 일반:일반 및 다중 기능; 단백질, 지질, 작은 분자 및 이온과의 상호작용.
  7. 기타/알 수 없는 기능, 바이러스 단백질 또는 독소.

SCOP 클래스 a ~ g의 각 도메인 슈퍼 패밀리는 이 방식을[17][18][19] 사용하여 수동으로 주석을 달았고 사용된 정보는 SCOP,[10] InterPro,[20][21] Pfam,[22] Swiss Prot [23]및 다양한 문헌 소스에 의해 제공되었습니다.

계통수

SUPERFAILY 사이트에서 사용 가능한 게놈을 3개 이상 선택하여 맞춤형 계통수를 만듭니다.트리는 경험적 절약법으로 생성되며 SUPERFAMILY의 모든 게놈에 대한 단백질 도메인 아키텍처 데이터를 기반으로 합니다.게놈 조합 또는 특정 군락은 개별 트리로 표시될 수 있습니다.

유사한 도메인 아키텍처

이 기능을 통해 사용자는 관심 있는 도메인 아키텍처와 가장 유사한 10개의 도메인 아키텍처를 찾을 수 있습니다.

숨겨진 마르코프 모형

SUPERFAILY 숨겨진 마르코프 모델을 사용하여 시퀀스에 대한 SCOP 도메인 할당을 생성합니다.

프로필 비교

HMM 검색에서 중요한 일치를 찾지 못한 경우 일치하는 원격 도메인 찾기프로파일 비교(PRC)[24]를 사용하여 2개의 프로파일HM을 정렬하고 스코어링합니다.

웹 서비스

분산 주석 서버 및 SUPER FAMILY에 링크합니다.

다운로드

시퀀스, 할당, 모델, MySQL 데이터베이스 및 스크립트 - 매주 업데이트됩니다.

연구에 사용

SUPERFAILY 데이터베이스에는 수많은 연구 어플리케이션이 있으며 많은 연구 그룹에서 다양한 연구를 위해 사용되어 왔다.이는 사용자가 다른 방법으로 검사하기를 원하는 단백질의 데이터베이스 역할을 하거나, 신규 또는 특성화되지 않은 단백질에 기능과 구조를 할당하는 역할을 할 수 있다.한 연구는 SUPERFAILY가 숨겨진 마르코프 [25]모델과 비교함으로써 미지의 함수의 많은 도메인에 적절한 함수와 구조를 올바르게 할당하는 데 매우 능숙하다는 것을 발견했다.또 다른 연구는 SUPERFAILY를 사용하여 세포 [26]다양화의 기원을 식별하기 위해 프로테옴과 기능군의 비교를 사용하여 1,733개의 Fold Superfamily 도메인(FSF)의 데이터 세트를 생성했다.

레퍼런스

  1. ^ Wilson, D; Pethica, R; Zhou, Y; Talbot, C; Vogel, C; Madera, M; Chothia, C; Gough, J (January 2009). "SUPERFAMILY--sophisticated comparative genomics, data mining, visualization and phylogeny". Nucleic Acids Research. 37 (Database issue): D380-6. doi:10.1093/NAR/GKN762. ISSN 0305-1048. PMC 2686452. PMID 19036790. Wikidata Q26781958.
  2. ^ Madera, Martin; Vogel, Christine; Kummerfeld, Sarah K.; Chothia, Cyrus; Gough, Julian (2004-01-01). "The SUPERFAMILY database in 2004: additions and improvements". Nucleic Acids Research. 32 (suppl 1): D235–D239. doi:10.1093/nar/gkh117. ISSN 0305-1048. PMC 308851. PMID 14681402.
  3. ^ Wilson, D.; Madera, M.; Vogel, C.; Chothia, C.; Gough, J. (2007). "The SUPERFAMILY database in 2007: Families and functions". Nucleic Acids Research. 35 (Database issue): D308–D313. doi:10.1093/nar/gkl910. PMC 1669749. PMID 17098927.
  4. ^ Gough, J. (2002). "The SUPERFAMILY database in structural genomics". Acta Crystallographica Section D. 58 (Pt 11): 1897–1900. doi:10.1107/s0907444902015160. PMID 12393919.
  5. ^ Gough, J.; Chothia, C. (2002). "SUPERFAMILY: HMMs representing all proteins of known structure. SCOP sequence searches, alignments and genome assignments". Nucleic Acids Research. 30 (1): 268–272. doi:10.1093/nar/30.1.268. PMC 99153. PMID 11752312.
  6. ^ a b De Lima Morais, D. A.; Fang, H.; Rackham, O. J. L.; Wilson, D.; Pethica, R.; Chothia, C.; Gough, J. (2010). "SUPERFAMILY 1.75 including a domain-centric gene ontology method". Nucleic Acids Research. 39 (Database issue): D427–D434. doi:10.1093/nar/gkq1130. PMC 3013712. PMID 21062816.
  7. ^ Oates, M. E.; Stahlhacke, J; Vavoulis, D. V.; Smithers, B; Rackham, O. J.; Sardar, A. J.; Zaucha, J; Thurlby, N; Fang, H; Gough, J (2015). "The SUPERFAMILY 1.75 database in 2014: A doubling of data". Nucleic Acids Research. 43 (Database issue): D227–33. doi:10.1093/nar/gku1041. PMC 4383889. PMID 25414345.
  8. ^ a b Hubbard, T. J.; Ailey, B.; Brenner, S. E.; Murzin, A. G.; Chothia, C. (1999). "SCOP: A Structural Classification of Proteins database". Nucleic Acids Research. 27 (1): 254–256. doi:10.1093/nar/27.1.254. PMC 148149. PMID 9847194.
  9. ^ Lo Conte, L.; Ailey, B.; Hubbard, T. J.; Brenner, S. E.; Murzin, A. G.; Chothia, C. (2000). "SCOP: A Structural Classification of Proteins database". Nucleic Acids Research. 28 (1): 257–259. doi:10.1093/nar/28.1.257. PMC 102479. PMID 10592240.
  10. ^ a b Andreeva, Antonina; Howorth, Dave; Brenner, Steven E.; Hubbard, Tim J. P.; Chothia, Cyrus; Murzin, Alexey G. (2004-01-01). "SCOP database in 2004: refinements integrate structure and sequence family data". Nucleic Acids Research. 32 (Database issue): D226–D229. doi:10.1093/nar/gkh039. ISSN 0305-1048. PMC 308773. PMID 14681400.
  11. ^ Dayhoff, M. O.; McLaughlin, P. J.; Barker, W. C.; Hunt, L. T. (1975-04-01). "Evolution of sequences within protein superfamilies". Naturwissenschaften. 62 (4): 154–161. Bibcode:1975NW.....62..154D. doi:10.1007/BF00608697. ISSN 0028-1042. S2CID 40304076.
  12. ^ Gough, J.; Karplus, K.; Hughey, R.; Chothia, C. (2001). "Assignment of homology to genome sequences using a library of hidden Markov models that represent all proteins of known structure1". Journal of Molecular Biology. 313 (4): 903–919. CiteSeerX 10.1.1.144.6577. doi:10.1006/jmbi.2001.5080. PMID 11697912.
  13. ^ Karplus, K.; Barrett, C.; Hughey, R. (1998-01-01). "Hidden Markov models for detecting remote protein homologies". Bioinformatics. 14 (10): 846–856. doi:10.1093/bioinformatics/14.10.846. ISSN 1367-4803. PMID 9927713.
  14. ^ Botstein, D.; Cherry, J. M.; Ashburner, M.; Ball, C. A.; Blake, J. A.; Butler, H.; Davis, A. P.; Dolinski, K.; Dwight, S. S.; Eppig, J. T.; Harris, M. A.; Hill, D. P.; Issel-Tarver, L.; Kasarskis, A.; Lewis, S.; Matese, J. C.; Richardson, J. E.; Ringwald, M.; Rubin, G. M.; Sherlock, G. (2000). "Gene ontology: Tool for the unification of biology. The Gene Ontology Consortium". Nature Genetics. 25 (1): 25–29. doi:10.1038/75556. PMC 3037419. PMID 10802651. open access
  15. ^ Barrell, Daniel; Dimmer, Emily; Huntley, Rachael P.; Binns, David; O’Donovan, Claire; Apweiler, Rolf (2009-01-01). "The GOA database in 2009—an integrated Gene Ontology Annotation resource". Nucleic Acids Research. 37 (suppl 1): D396–D403. doi:10.1093/nar/gkn803. ISSN 0305-1048. PMC 2686469. PMID 18957448.
  16. ^ Tatusov, Roman L; Fedorova, Natalie D; Jackson, John D; Jacobs, Aviva R; Kiryutin, Boris; Koonin, Eugene V; Krylov, Dmitri M; Mazumder, Raja; Mekhedov, Sergei L (2003-09-11). "The COG database: an updated version includes eukaryotes". BMC Bioinformatics. 4: 41. doi:10.1186/1471-2105-4-41. ISSN 1471-2105. PMC 222959. PMID 12969510.
  17. ^ Vogel, Christine; Berzuini, Carlo; Bashton, Matthew; Gough, Julian; Teichmann, Sarah A. (2004-02-20). "Supra-domains: evolutionary units larger than single protein domains". Journal of Molecular Biology. 336 (3): 809–823. CiteSeerX 10.1.1.116.6568. doi:10.1016/j.jmb.2003.12.026. ISSN 0022-2836. PMID 15095989.
  18. ^ Vogel, Christine; Teichmann, Sarah A.; Pereira-Leal, Jose (2005-02-11). "The relationship between domain duplication and recombination". Journal of Molecular Biology. 346 (1): 355–365. doi:10.1016/j.jmb.2004.11.050. ISSN 0022-2836. PMID 15663950.
  19. ^ Vogel, Christine; Chothia, Cyrus (2006-05-01). "Protein Family Expansions and Biological Complexity". PLOS Computational Biology. 2 (5): e48. Bibcode:2006PLSCB...2...48V. doi:10.1371/journal.pcbi.0020048. ISSN 1553-734X. PMC 1464810. PMID 16733546.
  20. ^ Mulder, Nicola J.; Apweiler, Rolf; Attwood, Teresa K.; Bairoch, Amos; Barrell, Daniel; Bateman, Alex; Binns, David; Biswas, Margaret; Bradley, Paul (2003-01-01). "The InterPro Database, 2003 brings increased coverage and new features". Nucleic Acids Research. 31 (1): 315–318. doi:10.1093/nar/gkg046. ISSN 0305-1048. PMC 165493. PMID 12520011.
  21. ^ Mulder, Nicola J.; Apweiler, Rolf; Attwood, Teresa K.; Bairoch, Amos; Bateman, Alex; Binns, David; Bradley, Paul; Bork, Peer; Bucher, Phillip (2005-01-01). "InterPro, progress and status in 2005". Nucleic Acids Research. 33 (Database Issue): D201–D205. doi:10.1093/nar/gki106. ISSN 0305-1048. PMC 540060. PMID 15608177.
  22. ^ Finn, Robert D.; Mistry, Jaina; Schuster-Böckler, Benjamin; Griffiths-Jones, Sam; Hollich, Volker; Lassmann, Timo; Moxon, Simon; Marshall, Mhairi; Khanna, Ajay (2006-01-01). "Pfam: clans, web tools and services". Nucleic Acids Research. 34 (Database issue): D247–D251. doi:10.1093/nar/gkj149. ISSN 0305-1048. PMC 1347511. PMID 16381856.
  23. ^ Boeckmann, Brigitte; Blatter, Marie-Claude; Famiglietti, Livia; Hinz, Ursula; Lane, Lydie; Roechert, Bernd; Bairoch, Amos (2005-11-01). "Protein variety and functional diversity: Swiss-Prot annotation in its biological context". Comptes Rendus Biologies. 328 (10–11): 882–899. doi:10.1016/j.crvi.2005.06.001. ISSN 1631-0691. PMID 16286078.
  24. ^ Madera, Martin (2008-11-15). "Profile Comparer: a program for scoring and aligning profile hidden Markov models". Bioinformatics. 24 (22): 2630–2631. doi:10.1093/bioinformatics/btn504. ISSN 1367-4803. PMC 2579712. PMID 18845584.
  25. ^ Mudgal, Richa; Sandhya, Sankaran; Chandra, Nagasuma; Srinivasan, Narayanaswamy (2015-07-31). "De-DUFing the DUFs: Deciphering distant evolutionary relationships of Domains of Unknown Function using sensitive homology detection methods". Biology Direct. 10 (1): 38. doi:10.1186/s13062-015-0069-2. PMC 4520260. PMID 26228684.
  26. ^ Nasir, Arshan; Caetano-Anollés, Gustavo (2013). "Comparative Analysis of Proteomes and Functionomes Provides Insights into Origins of Cellular Diversification". Archaea. 2013: 648746. doi:10.1155/2013/648746. PMC 3892558. PMID 24492748.

외부 링크