가중상관망분석
Weighted correlation network analysis가중유전자 공동표현망 분석(WGCNA)이라고도 하는 가중상관망 분석은 변수들 간의 쌍방향 상관관계에 기초한 생물학적 네트워크를 연구하기 위해 특히 널리 사용되는 데이터 마이닝 방법이다. 대부분의 고차원 데이터 세트에 적용할 수 있지만, 게놈 어플리케이션에서 가장 널리 사용되어 왔다. 모듈 멤버십에 관한 모듈(클러스터), 모듈내 허브, 네트워크 노드를 정의하고, 공동표현 모듈 간의 관계를 연구할 수 있으며, 서로 다른 네트워크의 네트워크 토폴로지를 비교(차등 네트워크 분석)할 수 있다. WGCNA는 데이터 감소 기법(사선 인자 분석 관련), 클러스터링 방법(퍼지 클러스터링), 형상 선택 방법(예: 유전자 선별 방법), 보완적(유전자 검사 방법) 데이터 통합 프레임워크(정량 변수 간의 가중 상관 관계 기반), 데이터 탐색 기술로서 사용할 수 있다.nique.[1] WGCNA는 전통적인 데이터 탐색 기법을 통합하지만, 그것의 직관적인 네트워크 언어와 분석 프레임워크는 어떤 표준 분석 기법을 초월한다. 네트워크 방법론을 사용하며 보완적 유전학 데이터 세트를 통합하는 데 적합하기 때문에 시스템 생물학적 또는 시스템 유전자 데이터 분석 방법으로 해석할 수 있다. 컨센서스 모듈에서 모듈 내 허브를 선택함으로써, WGCNA는 네트워크 기반의 메타 분석 기법도 만들어 낸다.[2]
역사
The WGCNA method was developed by Steve Horvath, a professor of human genetics at the David Geffen School of Medicine at UCLA and of biostatistics at the UCLA Fielding School of Public Health and his colleagues at UCLA, and (former) lab members (in particular Peter Langfelder, Bin Zhang, Jun Dong). 작업의 상당 부분은 응용 연구자들과의 협력에서 비롯되었다. 특히 암 연구자 폴 미셀, 스탠리 F와 공동 토론에서 가중 상관관계 네트워크가 개발됐다. 넬슨, 신경과학자 대니얼 H. 게쉬윈드, 마이클 C. Oldham(의[1] 승인 섹션에 따름). 종속 네트워크, 스케일 프리 네트워크, 코엑스프레션 네트워크에 관한 방대한 문헌이 있다.[citation needed]
가중 상관 관계 네트워크와 가중되지 않은 상관 관계 네트워크 비교
가중 상관 네트워크는 가중 네트워크, 종속 네트워크 또는 상관 네트워크의 특별한 사례로 해석할 수 있다. 가중 상관 관계 네트워크 분석은 다음과 같은 이유로 매력적일 수 있다.
- 네트워크 구성(상관 계수의 소프트 임계값에 기반함)은 기본 상관관계 정보의 연속적 특성을 보존한다. 예를 들어, 숫자 변수들 간의 상관관계를 기초로 구성된 가중 상관관계 네트워크는 하드 임계값을 선택할 필요가 없다. 정보의 이분법화와 (경직) 소유는 정보 손실로 이어질 수 있다.[3]
- 네트워크 구축은 소프트 임계값의 다른 선택과 관련하여 매우 강력한 결과를 제공한다.[3] 이와는 대조적으로 쌍방향 연결 측정값을 임계값으로 설정하여 가중치가 없는 네트워크에 기반한 결과는 종종 임계값에 크게 의존한다.
- 가중 상관관계 네트워크는 상관관계의 각도 해석에 기초한 기하학적 해석을 용이하게 한다(6장 into).[4]
- 유사도 측정은 종종 가중 네트워크로 변환될 수 있기 때문에 결과 네트워크 통계는 클러스터 분석과 같은 표준 데이터 마이닝 방법을 개선하는 데 사용될 수 있다.[5] 6장 참조.[4]
- WGCNA는 다른 조건과의 유사성을 정량화하는 데 사용할 수 있는 강력한 모듈 보존 통계를 제공한다. 또한 모듈 보존 통계는 네트워크의 모듈형 구조 사이의 차이를 연구할 수 있게 한다.[6]
- 가중 네트워크와 상관관계 네트워크는 종종 "사실화할 수 있는" 네트워크로 근사치를 구할 수 있다.[4][7] 그러한 근사치는 종종 희소하고 가중치가 없는 네트워크에서는 달성하기 어렵다. 따라서 가중(상관) 네트워크는 (모듈 및 모듈 멤버십 측면에서) 패러모니언 파라메트리제이션( )을 허용한다([8]의 2, 6장).
방법
첫째, 네트워크를 정의하는 데 사용되는 유전자 공동표현 유사성 측정을 정의한다. 우리는 s 에 의한 한 쌍의 유전자 i와 j의 유전자 공동표현 유사도 측정치를 나타낸다 많은 공동표현 연구들은 상관관계의 절대값을 서명되지 않은 공동표현 유사도 측정으로 사용한다.
여기서 유전자 표현 프로파일 및 는 여러 표본에 걸쳐 유전자 i와 j의 표현으로 구성된다. 그러나 상관관계의 절대값을 사용하면 유전자 억제와 활성화 사이에 구분이 이루어지지 않기 때문에 생물학적으로 관련 정보가 난독화될 수 있다. 대조적으로, 서명된 네트워크에서 유전자의 유사성은 그들의 표현 프로파일의 상관관계의 기호를 반영한다. 유전자 표현 프로파일 와 x 사이에 서명된 공동 표현 측정값을 정의하려면 다음과 같은 간단한 상관관계 변환을 사용할 수 있다.
서명되지 않은 u u d 서명된 s s i j s i g e signed은 0과 1 사이의 값을 취한다. 반대 방향으로 표현된 두 유전자( r( i, )=- 사이의 부호화되지 않은 유사성은 1인 반면 부호화된 유사성은 0인 것에 유의하십시오. 마찬가지로 상관관계가 0인 두 유전자의 서명되지 않은 공동표현 측정치는 0인 반면 서명된 유사성은 0.5이다.
다음으로 인접 행렬(네트워크) =[ 을 사용하여 유전자가 서로 얼마나 강하게 연결되어 있는지 계량화한다. 은(는) 공동 표현 유사성 매트릭스 =[ S의 임계값으로 정의된다. 유사성 측정 S은(디코토메이션화) 비가중 유전자 공동 표현 네트워크를 생성한다. 특히 가중치가 없는 네트워크 인접성은 > 인 경우 1로 정의되고, 않은 경우 0으로 정의된다. 하드 임계값링은 유전자 연결을 바이너리 방식으로 암호화하기 때문에 임계값 선택에 민감할 수 있고 공동 표현 정보의 상실을 초래할 수 있다.[3] 공동표현 정보의 지속적 특성은 가중 네트워크가 되는 소프트 임계값을 채택하여 보존할 수 있다. 특히 WGCNA는 다음과 같은 전력 기능을 사용하여 연결 강도를 평가한다.
=( s )
여기서 power }은(는) 소프트 임계값 지정 매개 변수다. 기본 값 = 및 = 이(가) 각각 서명되지 않은 네트워크에 사용된다. β 을(를) 선택할 수 있으며, 이는 대략적인 자유 토폴로지에 도달하는 것과 같은 }의 최소값을 선택하는 것과 같다.[3]
g( )= l g j) 가중 네트워크 인접성은 로그 척도의 공동 표현 유사성과 선형 관계가 있다. 고출력 은(는) 높은 유사성을 높은 보조성으로 변환하는 동시에 낮은 유사성을 0으로 유도한다는 점에 유의하십시오. 쌍방향 상관 행렬에 적용된 이 연성-임계절차는 가중 인접 행렬로 이어지기 때문에, 후속 분석을 가중 유전자 공동 표현 네트워크 분석이라고 한다.
모듈 중심 분석의 주요 단계는 네트워크 근접도를 이용하여 유전자를 네트워크 모듈로 묶는 것이다. 대략적으로 말하면, 한 쌍의 유전자는 서로 밀접하게 연결되어 있으면 근접성이 높다. 관례상 두 유전자의 최대 근접성은 1이고 최소 근접성은 0이다. 일반적으로 WGCNA는 위상학적 중복 측정(TOM)을 근접성으로 사용한다.[9][10] 가중 네트워크에 대해서도 정의할 수 있다.[3] TOM은 두 유전자의 인접성과 이 두 유전자가 다른 "제3자" 유전자와 공유하는 연결 강도를 결합한다. TOM은 네트워크 상호연결성(근접성)의 매우 강력한 척도다. 이 근접성은 평균 연결 계층적 군집화의 입력으로 사용된다. 모듈은 동적 분기 절단 접근방식을 사용하여 결과 클러스터 트리의 분기로 정의된다.[11] 다음으로 주어진 모듈 내부의 유전자를 모듈 에이지엔으로 요약하여 표준화된 모듈 표현 데이터를 가장 잘 요약한 것으로 간주할 수 있다.[4] 주어진 모듈의 모듈 아이겐젠은 표준화된 표현식 프로파일의 첫 번째 주요 구성요소로 정의된다. 에이겐젠은 강력한 바이오마커를 정의하며 [12]베이시안 네트워크와 같은 복잡한 기계 학습 모델에서 특징으로 사용할 수 있다.[13] 관심의 임상적 특성과 관련된 모듈을 찾기 위해 모듈 에이겐젠은 관심의 임상적 특성과 상관관계가 있어 에이겐겐의 유의성 측정이 발생한다. 아이겐세인은 의사결정 나무와 베이지안 네트워크를 포함한 보다 복잡한 예측 모델에서 특징으로 사용될 수 있다.[12] 또한 모듈 아이겐게네(eigengene 네트워크), 즉 노드가 모듈인 네트워크 간에 공동 표현 네트워크를 구축할 수 있다.[14] 주어진 모듈 안에서 세포내 허브 유전자를 식별하기 위해 두 가지 유형의 연결 수단을 사용할 수 있다. 첫 번째( M i= r( , E) 은각 유전자와 각 모듈 에이겐젠의 상관관계를 바탕으로 정의된다. kIN이라고 불리는 두 번째 것은 모듈 유전자에 대한 보조성의 합으로 정의된다. 실제로 이 두 가지 척도는 동등하다.[4] 모듈이 다른 데이터 세트에 보존되는지 여부를 테스트하기 위해 다양한 네트워크 통계(: Z [6]를 사용할 수 있다.
적용들
WGCNA는 유전자 발현 데이터(즉, 전사 데이터)를 분석하는 데 널리 사용되어 왔으며, 예를 들어 세포 내 허브 유전자를 찾는 데 사용되었다.[2][15] 예를 들어, WGCNA 연구는 새로운 전사 인자가 비스페놀 A (BPA) 선량-반응과 관련이 있다는 것을 보여준다.[16]
모듈(module eigengenenes)과 같은 "모듈 아이겐젠젠"으로 대표되는 시스템 유전자 애플리케이션에서 데이터 감소 단계로 자주 사용된다.[17][18] 모듈 아이겐젠은 모듈을 임상적 특성과 상관시키는 데 사용될 수 있다. 모듈 eigengenes 사이에 미세 배열을 포함한Eigengene 네트워크 coexpression 네트워크(그의 노드는 모듈 및 네트워크). WGCNA 널리neuroscientific 응용 프로그램, e.g.[19][20]에 유전체 데이터 분석을 이용하다 data,[21]하나의 세포 RNA-Seq data[22][23]DNA메틸화 data,[24]miRNA 데이터, 펩티드 counts[25]과 microbiota dAta(16S rRNA유전자 sequenci.ng).[26] 기능적 MRI 데이터와 같은 뇌 영상 데이터를 다른 용도로 사용한다.[27]
R 소프트웨어 패키지
WGCNA R 소프트웨어 패키지는[28] 가중 네트워크 분석의 모든 측면(모듈 구축, 허브 유전자 선택, 모듈 보존 통계, 차등 네트워크 분석, 네트워크 통계)을 수행하기 위한 기능을 제공한다. WGCNA 패키지는 R 애드온 패키지의 표준 저장소인 종합 R 아카이브 네트워크(CLAN)에서 사용할 수 있다.
참조
- ^ a b c Horvath S (2011). Weighted Network Analysis: Application in Genomics and Systems Biology. New York, NY: Springer. ISBN 978-1-4419-8818-8.
- ^ a b Langfelder P, Mischel PS, Horvath S, Ravasi T (17 April 2013). "When Is Hub Gene Selection Better than Standard Meta-Analysis?". PLOS ONE. 8 (4): e61505. Bibcode:2013PLoSO...861505L. doi:10.1371/journal.pone.0061505. PMC 3629234. PMID 23613865.
- ^ a b c d e Zhang B, Horvath S (2005). "A general framework for weighted gene co-expression network analysis" (PDF). Statistical Applications in Genetics and Molecular Biology. 4: 17. CiteSeerX 10.1.1.471.9599. doi:10.2202/1544-6115.1128. PMID 16646834. S2CID 7756201.
- ^ a b c d e Horvath S, Dong J (2008). "Geometric Interpretation of Gene Coexpression Network Analysis". PLOS Computational Biology. 4 (8): e1000117. Bibcode:2008PLSCB...4E0117H. doi:10.1371/journal.pcbi.1000117. PMC 2446438. PMID 18704157.
- ^ Oldham MC, Langfelder P, Horvath S (12 June 2012). "Network methods for describing sample relationships in genomic datasets: application to Huntington's disease". BMC Systems Biology. 6: 63. doi:10.1186/1752-0509-6-63. PMC 3441531. PMID 22691535.
- ^ a b Langfelder P, Luo R, Oldham MC, Horvath S (20 January 2011). "Is my network module preserved and reproducible?". PLOS Computational Biology. 7 (1): e1001057. Bibcode:2011PLSCB...7E1057L. doi:10.1371/journal.pcbi.1001057. PMC 3024255. PMID 21283776.
- ^ Dong J, Horvath S (4 June 2007). "Understanding network concepts in modules". BMC Systems Biology. 1: 24. doi:10.1186/1752-0509-1-24. PMC 3238286. PMID 17547772.
- ^ Ranola JM, Langfelder P, Lange K, Horvath S (14 March 2013). "Cluster and propensity based approximation of a network". BMC Systems Biology. 7: 21. doi:10.1186/1752-0509-7-21. PMC 3663730. PMID 23497424.
- ^ Ravasz E, Somera AL, Mongru DA, Oltvai ZN, Barabasi AL (2002). "Hierarchical organization of modularity in metabolic networks". Science. 297 (5586): 1551–1555. arXiv:cond-mat/0209244. Bibcode:2002Sci...297.1551R. doi:10.1126/science.1073374. PMID 12202830. S2CID 14452443.
- ^ Yip AM, Horvath S (24 January 2007). "Gene network interconnectedness and the generalized topological overlap measure". BMC Bioinformatics. 8: 22. doi:10.1186/1471-2105-8-22. PMC 1797055. PMID 17250769.
- ^ Langfelder P, Zhang B, Horvath S (2007). "Defining clusters from a hierarchical cluster tree: the Dynamic Tree Cut library for R". Bioinformatics. 24 (5): 719–20. doi:10.1093/bioinformatics/btm563. PMID 18024473. S2CID 1095190.
- ^ a b Foroushani A, Agrahari R, Docking R, Chang L, Duns G, Hudoba M, Karsan A, Zare H (16 March 2017). "Large-scale gene network analysis reveals the significance of extracellular matrix pathway and homeobox genes in acute myeloid leukemia: an introduction to the Pigengene package and its applications". BMC Medical Genomics. 10 (1): 16. doi:10.1186/s12920-017-0253-6. PMC 5353782. PMID 28298217.
- ^ Agrahari, Rupesh; Foroushani, Amir; Docking, T. Roderick; Chang, Linda; Duns, Gerben; Hudoba, Monika; Karsan, Aly; Zare, Habil (3 May 2018). "Applications of Bayesian network models in predicting types of hematological malignancies". Scientific Reports. 8 (1): 6951. Bibcode:2018NatSR...8.6951A. doi:10.1038/s41598-018-24758-5. ISSN 2045-2322. PMC 5934387. PMID 29725024.
- ^ Langfelder P, Horvath S (2007). "Eigengene networks for studying the relationships between co-expression modules". BMC Systems Biology. 2007 (1): 54. doi:10.1186/1752-0509-1-54. PMC 2267703. PMID 18031580.
- ^ Horvath S, Zhang B, Carlson M, Lu KV, Zhu S, Felciano RM, Laurance MF, Zhao W, Shu Q, Lee Y, Scheck AC, Liau LM, Wu H, Geschwind DH, Febbo PG, Kornblum HI, Cloughesy TF, Nelson SF, Mischel PS (2006). "Analysis of Oncogenic Signaling Networks in Glioblastoma Identifies ASPM as a Novel Molecular Target". PNAS. 103 (46): 17402–17407. Bibcode:2006PNAS..10317402H. doi:10.1073/pnas.0608396103. PMC 1635024. PMID 17090670.
- ^ Hartung, Thomas; Kleensang, Andre; Tran, Vy; Maertens, Alexandra (2018). "Weighted Gene Correlation Network Analysis (WGCNA) Reveals Novel Transcription Factors Associated With Bisphenol A Dose-Response". Frontiers in Genetics. 9: 508. doi:10.3389/fgene.2018.00508. ISSN 1664-8021. PMC 6240694. PMID 30483308.
- ^ Chen Y, Zhu J, Lum PY, Yang X, Pinto S, MacNeil DJ, Zhang C, Lamb J, Edwards S, Sieberts SK, Leonardson A, Castellini LW, Wang S, Champy MF, Zhang B, Emilsson V, Doss S, Ghazalpour A, Horvath S, Drake TA, Lusis AJ, Schadt EE (27 March 2008). "Variations in DNA elucidate molecular networks that cause disease". Nature. 452 (7186): 429–35. Bibcode:2008Natur.452..429C. doi:10.1038/nature06757. PMC 2841398. PMID 18344982.
- ^ Plaisier CL, Horvath S, Huertas-Vazquez A, Cruz-Bautista I, Herrera MF, Tusie-Luna T, Aguilar-Salinas C, Pajukanta P, Storey JD (11 September 2009). "A Systems Genetics Approach Implicates USF1, FADS3, and Other Causal Candidate Genes for Familial Combined Hyperlipidemia". PLOS Genetics. 5 (9): e1000642. doi:10.1371/journal.pgen.1000642. PMC 2730565. PMID 19750004.
- ^ Voineagu I, Wang X, Johnston P, Lowe JK, Tian Y, Horvath S, Mill J, Cantor RM, Blencowe BJ, Geschwind DH (25 May 2011). "Transcriptomic analysis of autistic brain reveals convergent molecular pathology". Nature. 474 (7351): 380–4. doi:10.1038/nature10110. PMC 3607626. PMID 21614001.
- ^ Hawrylycz MJ, Lein ES, Guillozet-Bongaarts AL, Shen EH, Ng L, Miller JA, van de Lagemaat LN, Smith KA, Ebbert A, Riley ZL, Abajian C, Beckmann CF, Bernard A, Bertagnolli D, Boe AF, Cartagena PM, Chakravarty MM, Chapin M, Chong J, Dalley RA, David Daly B, Dang C, Datta S, Dee N, Dolbeare TA, Faber V, Feng D, Fowler DR, Goldy J, Gregor BW, Haradon Z, Haynor DR, Hohmann JG, Horvath S, Howard RE, Jeromin A, Jochim JM, Kinnunen M, Lau C, Lazarz ET, Lee C, Lemon TA, Li L, Li Y, Morris JA, Overly CC, Parker PD, Parry SE, Reding M, Royall JJ, Schulkin J, Sequeira PA, Slaughterbeck CR, Smith SC, Sodt AJ, Sunkin SM, Swanson BE, Vawter MP, Williams D, Wohnoutka P, Zielke HR, Geschwind DH, Hof PR, Smith SM, Koch C, Grant S, Jones AR (20 September 2012). "An anatomically comprehensive atlas of the adult human brain transcriptome". Nature. 489 (7416): 391–399. Bibcode:2012Natur.489..391H. doi:10.1038/nature11405. PMC 4243026. PMID 22996553.
- ^ Kadarmideen HN, Watson-Haigh NS, Andronicos NM (2011). "Systems biology of ovine intestinal parasite resistance: disease gene modules and biomarkers". Molecular BioSystems. 7 (1): 235–246. doi:10.1039/C0MB00190B. PMID 21072409.
- ^ Kogelman LJ, Cirera S, Zhernakova DV, Fredholm M, Franke L, Kadarmideen HN (30 September 2014). "Identification of co-expression gene networks, regulatory genes and pathways for obesity based on adipose tissue RNA Sequencing in a porcine model". BMC Medical Genomics. 7 (1): 57. doi:10.1186/1755-8794-7-57. PMC 4183073. PMID 25270054.
- ^ Xue Z, Huang K, Cai C, Cai L, Jiang CY, Feng Y, Liu Z, Zeng Q, Cheng L, Sun YE, Liu JY, Horvath S, Fan G (29 August 2013). "Genetic programs in human and mouse early embryos revealed by single-cell RNA sequencing". Nature. 500 (7464): 593–7. Bibcode:2013Natur.500..593X. doi:10.1038/nature12364. PMC 4950944. PMID 23892778.
- ^ Horvath S, Zhang Y, Langfelder P, Kahn RS, Boks MP, van Eijk K, van den Berg LH, Ophoff RA (3 October 2012). "Aging effects on DNA methylation modules in human brain and blood tissue". Genome Biology. 13 (10): R97. doi:10.1186/gb-2012-13-10-r97. PMC 4053733. PMID 23034122.
- ^ Shirasaki DI, Greiner ER, Al-Ramahi I, Gray M, Boontheung P, Geschwind DH, Botas J, Coppola G, Horvath S, Loo JA, Yang XW (12 July 2012). "Network organization of the huntingtin proteomic interactome in mammalian brain". Neuron. 75 (1): 41–57. doi:10.1016/j.neuron.2012.05.024. PMC 3432264. PMID 22794259.
- ^ Maomeng Tong; Xiaoxiao Li; Laura Wegener Parfrey; et al. (2013). "A modular organization of the human intestinal mucosal microbiota and its association with inflammatory bowel disease". PLOS One. 8 (11): e80702. doi:10.1371/JOURNAL.PONE.0080702. ISSN 1932-6203. PMC 3834335. PMID 24260458. Wikidata Q21559533.
- ^ Mumford JA, Horvath S, Oldham MC, Langfelder P, Geschwind DH, Poldrack RA (1 October 2010). "Detecting network modules in fMRI time series: a weighted network analysis approach". NeuroImage. 52 (4): 1465–76. doi:10.1016/j.neuroimage.2010.05.047. PMC 3632300. PMID 20553896.
- ^ Langfelder P, Horvath S (29 December 2008). "WGCNA: an R package for weighted correlation network analysis". BMC Bioinformatics. 9: 559. doi:10.1186/1471-2105-9-559. PMC 2631488. PMID 19114008.