Мы используем файлы cookie.
Продолжая использовать сайт, вы даете свое согласие на работу с этими файлами.

Çoklu dizi hizalaması

Подписчиков: 0, рейтинг: 0
Çeşitli organizmaların ribozom proteini P0 (L10E)'ın çoklu dizi hizalamasının ilk 90 pozisyonu. ClustalX ile elde edilmiştir.

Çoklu dizi hizalaması, üç ya da çok biyolojik dizinin (genelde protein, DNA veya RNA dizisinin) dizi hizalamasıdır. Çoğu durumda, girdi kümesindeki sorgu dizilerinin evrimsel bir ilişkiye sahip olduğu, yani ortak bir ataya sahip oldukları varsayılır. Elde edilen çoklu dizi hizalamasından homoloji olduğu çıkarımı yapılabilir ve filogenetik analiz ile dizilerin evrimsel kökenleri değerlendirilebilir. Hizalamanın sağdaki resimdeki gibi gösterimiyle noktasal mutasyonlar, hizalamadaki sütunlardan birinde farklı bir harf olarak, ensersiyon ve delesyonlar ise hizalamadaki satırlardan bir veya daha fazlasında tire şeklinde beliren eklemeler şeklinde mutasyon olayları görülebilir. Protein bölgelerinde, ikincil veya üçüncül yapılarda ve hatta bireysel amino asit veya nükleotitlerin dizi korunumunu değerlendirmek için çoklu dizi hizalamaları sıkça kullanılır.

Çoklu dizi hizalaması terimi ayrıca bir dizi kümesinin hizalanması süreci için kullanılır. Üç veya daha çok dizinin elle hizalanması zor olduğu ve genelde çok zaman alıcı olduğu için hizalamaların üretim ve analizi için berimsel (hesaplamalı) algoritmalar kullanılır. ÇDH'ler ikili dizi hizalamasından daha ileri yöntemlerin kullanımını gerektirir çünkü berimsel olarak karmaşıktırlar. Nispeten kısa birkaç diziden fazlasının optimal hizalamasını bulmak berimsel bakımdan çok pahalıdır, bu yüzden çoğu çoklu dizileme programları global optimizasyon yerine höristik yöntemler kullanır.

Dinamik programlama ve berimsel karmaşıklık

Bir ÇDH üretiminde global optimal çözümünü bulmak için dinamik programlama tekniği kullanılır. Proteinler için, bu yöntem iki parametre grubu kullanılır: bir boşluk cezası ve bir substitusyon matrisi. Substitusyon matrisi, her bir amino asit çiftinin birbiriyle hizalanmasına karşılık gelen bir puan (skor) veya olasılık değeri içerir, bu değerler amino asitlerin kimyasal özelliklerinin benzerliğine ve mutasyonun olmasının evrimsel olasılığına dayalıdır. Nükleotit dizileri için benzer bir boşluk ceza değeri vardır ama substitusyon matrisi çok daha basittir, tipik olarak sadece aynı olma veya olmamaya göre skorlar bulunur. Substitusyon matrisindeki skorlar global hizalamalar durumunda ya sırf pozitif olabilir veya hem pozitif hem negatif değerler içerebilirler, ama lokal hizalama durumunda hem pozitif hem negatif değerler içermek zorundadır.

İki dizinin hizalanmasında bir matris kullanılmasından yola çıkarak, n adet dizinin hizalanması için, o matrisin n-boyutlu karşılığı bir matris kullanmak, çözüme ulaşmanın toy (saf) bir yolu olur. Bu yaklaşımın sonucu arama uzayı artan n ile üssel şekilde büyür ve dizi uzunluğuna da kuvvetle bağımlıdır. Berimsel karmaşıklığı ölçmekte kullanılan büyük O notasyonu ile ifade edilirse, toy yaklaşımla elde edilmiş bir ÇDH n dizi için O(Uzunlukn) sürede tamamlanır. Bu n dizi için global optimumu bulmanın NP-tam problem olduğu gösterilmiştir. Altschul, 1989'da, Carrillo-Lipman Algorithmasını kullanarak, n-boyutlu arama uzayının ikili hizalamalar yaparak sınırlanabileceğini göstermiştir. Bu yaklaşım ile, sorgu kümesindeki her bir dizi çifti için dinzmik programlama hizalamaları yapılır, sonra bu hizalamaların n-boyutlu kesişimi civarında n-li hizalama için arama yapılır. Bu ÇDH algoritması hizalamadaki her pozisyon için, karakter çiftlerinin toplamlarını (çiftler toplamı skorunu) optimize eder. Algoritma, çoklu dizi hizalaması yapan bir yazılım programı olarak uygulamaya sokulmuştur.

İlerleyici hizalama inşası

Çoklu dizi hizalamasında en yaygın kullanılan yöntem, ilerleyici (İng. progressive) yöntem olarak bilinen (hiyerarşik veya ağaç yöntemi olarak da bilinir) bir buluşsal (höristik) aramadır. Bu yöntemde, ÇDH'yi inşa etmek için önce birbirine en benzer olan çiftten başlanır, sonra gittikçe daha az benzeşen çiftler eklenir. İlerleyici hizalama yöntemlerinin hepsi iki aşamadan oluşur: diziler arasındaki ilişkinin kılavuz ağaç denen bir filogenetik ağaç olarak gösterildiği birinci aşama; ve büyüyen ÇDH'ye dizilerin sırayla eklenerek ÇDH'nin inşa edildiği bir ikinci aşama. İlk kılavuz ağacı oluşturmak için, dinamik programlama hizalaması yapmak yerine, verimli bir kümeleme (clustering) yöntemi kullanılır (komşu birleştirme veya UPGMA gibi). Kümelemede uzaklık değeri olarak aynı iki harfli altdizilerin sayısı kullanılabilir (FASTA programında olduğu gibi).

İlerleyici hizalamalar global optimal olamaz. Temel sorun, ÇDH oluşturulurken yapılan hataların nihai sonuca kadar taşınmasıdır. Kümedeki diziler birbirlerine uzaktan ilişkiliyse algoritmanın performansı özellikle kötüdür. Çoğu modern ilerleyici yöntemler, sorgu kümesinin her bir üyesi için skor fonksiyonlarını değiştirir. Bu değişken skor, dizilerin en yakın komşularına olan genetik uzaklığına bağlı olarak nonlineer değişen bir ağırlık fonksiyonuyla hesaplanır. Böylece, hizalama programının dizileri rastgele olmayan bir şekilde seçmesinin etkisi düzeltilmiş olur.

İlerleyici hizalama yöntemler, çok sayıda (yüzlerce ila binlerce arası) diziye uygulanabilecek derecede verimli çalışırlar. İlerleyici hizalama hizmetleri kamuya açık Web sunucularında mevcuttur, bu yüzden kullanıcılar bu programı kendi bilgisayarlarında kurmak zorunda değildirler. En popüler ilerleyici hizalama yöntemi Clustal ailesi olmuştur, özellikle ağırlıklı versiyonu olan clustalW bunlara çeşitli Web portallerindan erişilebilir (GenomeNet, EBI5 Ağustos 2010 tarihinde Wayback Machine sitesinde arşivlendi., and EMBNet1 Mayıs 2011 tarihinde Wayback Machine sitesinde arşivlendi. dahil olmak üzere). Farklı portaller veya uyarlamalar kullanıcı arayüzü ve kullanıcının değiştirebileceği parametreler bakımından faklılık gösterebilirler. ClustalW'nun doğrudan filogenetik ağaç inşası için kullanılmaması gerektiğine dair programcının açık ikazlarına rağmen, programın çıktıları bu amaç için yaygın olarak kullanılır. ClustalW çıktısı, homoloji modellemesi ile protein yapı öndeyisine girdi olarak da kullanılmamalıdır.

T-Coffee olarak adlandırılan bir diğer yaygın ilerleyici hizalama yöntemi, Clustal ve onun türevlerinden daha yavaştır ama birbiriyle uzaktan ilişkili diziler için daha doğru hizalamalar üretir. İkili hizalamalar hesaplamak için T-Coffee iki farklı yöntemle elde edilen hizalamaları birleştirir: çiftin doğrudan hizalaması ve, çiftteki her diziyi üçüncü bir dizi ile hizalanması ile elde edilen, indirekt hizalamalar. Bu program, hem Clustal çıktısını, hem de başka bir lokal hizalama programı olan ve iki dizideki çoklu lokal hizalanma bölgeleri bulan LALIGN programını kullanır. Elde edilen hizalama ve filogenetik ağaç, yeni ve daha doğru ağırlık faktörleri üretmek için kullanılır.

İleleyici yöntemler buluşsal oldukları için, global bir optimuma yakınsama garantileri yoktur, hizalamanın kalitesini değerlendirmek zor olabilir ve gerçek biyolojik anlamı belirsiz olabilir.

Tekrarlayıcı yöntemler

ÇDH üretip, ilerleyici yöntemlere özgü hataları azaltan bir yöntemler grubu "tekrarlayıcı" (iterative) olarak sınıflandırılmıştır, çünkü bunlar ilerleyici yöntemlere benzer olarak çalışmakla beraber, büyüyen ÇDH'ye yeni diziler eklerken ilk dizileri tekrar tekrar hizalamaya devam eder. İlerleyici yöntemlerin yüksek kaliteli ilk hizalamalara muhtaç olmalarının nedeni, bu hizalamaların hep nihai sonuçta yer almasıdır. Yani bir dizi bir ÇDH içinde yerini aldıktan sonra onun hizalaması tekrar gözden geçirilmez. Bu yaklaşıklık (approximation) berimsel hızı artırır ama doğruluktan kaybetme pahasına. Buna karşın, tekrarlayıcı yöntemler, daha önce hesaplanmış ikili hizalamalara veya sorgu dizisini içeren alt-ÇDH'ler geri gelebilirler. Bu sayede, yüksek kaliteli bir hizalama skoru elde etmeyi sağlayacak bir genel objektif fonksiyon optimize edilebilir.

Birbirinden ince farklılıklar gösteren çeşitli tekrarlayıcı yöntemler uygulamaya konmuş ve yazılım paketi olarak kullanıma sunulmuştur; bu yazılımlar hakkında çeşitli inceleme ve kıyaslama makaleleri "en iyi" yöntemi ilan etmekten kaçınmışlardır.PRRN/PRRP adlı yazılım paketi bir tepe tırmanma algoritması kullanır, ÇDH hizalama skorunu optimize etmek için. büyüyen ÇDH'nin hem hizalama ağırlıklarını hem de yerel olarak ıraksamış veya "boşluklu" bölgelerini tekrarlayan bir şekilde düzeltir. PRRP, daha hızlı bir yöntemle inşa edilmiş bir hizalamayı iyileştirmede kullanıldığında en iyi performans gösterir.

Başka bir tekrarlayıcı program, DIALIGN, ise olağandışı bir yaklaşım kullanır, boşluk cezası kullanmadan dizi motifleri veya alt dizilerin lokal hizalamalarına odaklanır. İkili hizalama yapmakta kullanılan bir nokta matris grafiğine benzer bir matris gösterimi kullanılarak bireysel motifler hizalanır. Yavaş bir global hizalama için hızlı lokal hizalamaları birer "tohum" olarak kullanan bir alternatif yöntem CHAOS/DIALIGN25 Ağustos 2010 tarihinde Wayback Machine sitesinde arşivlendi. paketinde kullanılır.

Tekrarlama-temelli üçüncü bir popüler yöntem MUSCLE23 Temmuz 2010 tarihinde Wayback Machine sitesinde arşivlendi. (multiple sequence alignment by log-expectation; log-beklenti ile çoklu dizi hizalaması) olarak adlandırılır, iki dizinin yakınlığını belirlemek için daha doğruluklu bir uzaklık değeri hesaplayarak, ilerleyici yöntemlerden daha yüksek bir başarı gösterir. Uzaklık ölçütü, tekrarlama aşamaları arasında yenilenir.

Gizli Markov modelleri

Gizli Markov modelleri (GMM), boşluk, uyuşma ve uyuşmamaların tüm kombinasyonlarına bir olasılık değeri atayan olasılıksal modellerdir. GMMler yüksek skorlu bir çıktı verebilirler ama ayrıca bir olasıl hizalamalar ailesi de üretebilirler, bunlar sonradan biyolojik anlamlılıkları bakımından değerlendirilebilir. GMM-temelli yöntemler nipeten yakın zamanda geliştirilmiş olmalarına rağmen, berimsel hızda önemli iyileşme göstermişlerdir, özellikle örtüşen bölgelere sahip dizilerde.

Tipik GMM-temelli yöntemler, bir ÇDH'yi kısmî-dereceli çizit (partial order graph) (bir yönlü asiklik çizit tipi) olarak temsil ederek çalışırlar. Bu çizitin düğümleri, ÇDH'nin sütunlarındaki olasıl değerleri temsil eder. Bu gösterimde, tamamen korunmuş bir sütun (yani ÇDH'deki tüm diziler bir pozisyonda aynı karaktere sahipler) tek bir düğüm olarak gösterilir, bu düğümden çıkan bağlantı sayısı, hizalamanın bir sonraki sütunundaki farklı karakter sayısına eşittir. Tipik bir gizli Markov modeli için, gözlemlenen haller, bireysel hizalama sütunlarıdır, "gizli" haller ise, sorgu kümseinde bulunan dizilerin evrimleşmiş olduğu varsayılan atasal diziyi temsil eder. Dinamik programlama yönteminin verimli bir varyantı olan Viterbi algoritması, büyüyen ÇDH'yi sorgu kümesindeki bir sonraki dizi ile hizalamak için kullanılır, böylece yeni bir ÇDH elde edilir. Bu yöntem, ilerleyici hizalama yönteminden farklıdır çünkü her yeni dizi eklenmesinde evvelki dizilerin hizalaması da yenilenir. Ancak, ilerleyici yöntemlerde olduğu gibi, bu yöntem de sorgu kümesindeki dizilerin hizalamaya katılmasının sırasına bağlı sonuç verebilir, özellikle diziler uzak ilişkilyse.

GMM-temelli yöntemlerin uygulandığı, verimlilikleri ve ölçeklenebilirlikleri bakımından başarılı sayılan çeşitli yazılım programları mevcuttur. Ancak GMM yöntemleri, yaygın ilerleyici yöntemlerden daha karmaşıktır. En basit olanı POA25 Aralık 2009 tarihinde Wayback Machine sitesinde arşivlendi. (Partial-Order Alignment Kısmî dereceli hizalama); ,

Benzer ama daha genelleştirilmiş bir yöntem SAM16 Ekim 2011 tarihinde Wayback Machine sitesinde arşivlendi. (Sequence Alignment and Modeling System Dizi hizalama ve modelleme sistemi)'dır. ve HMMER'dir. SAM, protein yapı öndeyisi yapmak için hizalama kaynağı olarak ve S. cerevisiae mayasında protein kodlayıcı öndeyili diziler içeren bir veri tabanı geliştirmek için kullanılmıştır. HHsearch GMMlerin ikili karşılaştırması ile uzak ilişkili protein dizilerinin tespiti için bir yazılımdır. HHsearch (HHpred) çalıştıran bir sunucu CASP7 and CASP8 yapı öndeyi yarışmasındaki en iyi 10 otomatik protein yapı öndeyi sunucularının en hızlısıydı.

Genetik algoritmalar ve benzetmeli tavlama

Bilgisayar bilimlerindeki standart optimizasyon teknikleri, kaliteli ÇDH üretimi için kullanılmıştır. Bu yöntemlerden biri olan genetik algoritmalar, sorgu kümesindeki dizileri meydana getiren evrimsel süreci ana hatlarıyla benzeterek (simüle ederek) ÇDH üretimi için kullanılmıştır. Bu yöntemde, bir seri olasıl ÇDH, kısa parçalara bölünür, ve bunların içinde çeşitli yerlere boşluklar konarak tekrar tekrar diziler düzenlenir. Genel bir objektif fonksiyon, (en yaygın olarak dinamik programlama ile ÇDH yöntemlerinde kullanılan "çiftler toplamı" maksimizasyon fonksiyonu) bu simülasyon sırasında optimize edilir. Protein dizileri için bir teknik, SAGA (Sequence Alignment by Genetic Algorithm Genetik algoritma ile dizi hizalaması) ve RNA iiçin onun karşılığı olan RAGA. adlı yazılım programlarında uygulanmıştır.

Benzetilmiş tavlama tekniğinde, başka bir yöntemle elde edilmiş mevcut bir ÇDH, bir seri yeniden düzenleme yoluyla iyileştilir. Hizalama uzayında başlangış hizalamasından daha optimal bölgeler bulunmaya çalışılır. Genetik algoritmada olduğu gibi benzetilmiş tavlama da çiftler toplamı gibi bir objektif fonksiyonu maksimize etmeye çalışır. Benzetilmiş tavlamada, mecazî bir "sıcaklık faktörü", değişimlerin meydana gelme hızını ve her bir değişimin olasılığını belirler; tipik kullanımda farklı özelliklere sahip olan iki tip evre vardır: yüksek değişim hızı ve nispeten düşük olasılıklara sahip evreler ile (hizalama uzayının uzak bölgelerini araştırmak için) düşük hız ve yüksek olasılıklı evreler (yeni varılmış bir bölgedeki lokal minimumları daha ayrıntılı olarak keşif yapmak için) birbirini takip eder. Bu yaklaşım MSASA (Multiple Sequence Alignment by Simulated Annealing) programında uygulanmıştır.

Motif bulma

Drosophila'nın yedi kaspaz dizisinin hizalanması ve MEME programı tarafından tespit edilmiş renkli olarak gösterilen motifler. Motif pozisyonları ve dizi hizalamaları birbirlerinden bağımsız olarak üretilirse birbirleriyle bağıntıları bu örnekte görüldüğü üzere genelde iyidir ama mükemmel değildir.

Motif bulmak veya bir diğer adıyla profil analizi, global ÇDH'de dizi motifi bulma yöntemidir. Hem daha iyi ÇDH üretmeye hem de benzer motifler içeren başka benzer diziler bulmak için bir skor matrisi üretmeye yarar. Motifleri bulmak için çeşitli yöntemler geliştirilmiştir, bunların hepsi, büyük bir hizalama içinde yer alan, çok korunmuş, kısa dizi örüntüleri (motifleri) bulmaya, sonra da bulunan motifin her pozisyonundaki nükleotit veya amino asit bileşimini yansıtan, substitusyon matrisine benzer bir matris inşasına dayalıdır. Bu matrisler kullanılarak hizalama daha da iyileştirilebilir. Standart profil analizinde, matriste her karakter ve ayrıca boşluk için değerler bulunur. Alternatif olarak, istatistik örüntü bulma algoritmaları ile bulunan motifler, ÇDH için bir ön adım oluşturabilir, ondan türeyen bir bilgi olmak yerine. Çoğu durumda, sorgu kümesi eğer az sayıda dizi içerirse veya birbirine çok benzeyen diziler içerirse, skor matrisindeki dağılımı normalleştirmek için sahtesayılar (pseudocount) eklenebilir. Bu yolla matriste sıfır sıklığa sahip değerler sıfır olmayan küçük değerlere dönüştürülür.

Blok analizi, motifleri hizalamada boşluksuz bölgelere sınırlayan bir motif bulma yöntemidir. Bloklar bir ÇDH'den üretilebilir veya hizalanmamış dizilerden, bilinen gen ailelerinden elde edilmiş, önceden hesaplanmış motif grupları kullanılarak hizalanmamış dizilerden bulunabilir. Blok skorlaması genelde yüksek frekanslı karakterlerin arasındaki uzaklığa dayalıdır, bir substitusyon matrisinin hesaplanması yerine. BLOCKS sunucusu hizalanmamış dizilerde bu tür motiflerin bulunması için enteraktif bir yöntem sağlar.

İstatistik örüntü eşleme (pattern-matching), hem beklenti maksimizasyon algoritması hem de Gibbs örnekleyicisi için uygulanmıştır. En yaygın motif bulma araçlarından biri olan MEME, motif bulmak için beklenti maksimizasyon ve gizli Markov modelleri kullanır, bu motifler sonra MEME/MAST paketindeki yardımcı program MAST tarafından arama aracı olarak kullanılır.

Görselleme ve düzeltim (editing) araçları

Çoklu dizi hizalamasında buluşsal (höristik) yöntemlerin kullanılması, herhangi bir grup protein dizilerinin hizalamasında hata olma olasılığının yüksek olacağı anlamını taşır. Evrim sırasında dizilerden bir veya birkaçına rastgele bir insersiyon olması, veya daha karmaşık bir evrimsel süreç sonucu dizi analizi ile kolayca hizalanamayan proteinler meydana gelmesi bu tür hatalar meydana gelebilir. Çoklu dizi hizalama görüntüleyicileri hizalamaların görsel şekilde kontrolüne olanak verir. İki veya daha çok dizide tanımlanmış olan işlevsel konumlara bakılarak hizalama kalitesi anlaşılabilir. Bu programların çoğu, bu tür (genelde ufak) hataların düzeltilmesini de sağlar, böylece filogenetik analiz veya karşılaştırmalı modelleme için uygun, optimal, bir uzman tarafından düzenlenmiş (curated) hizalama elde edilmiş olur.

Filogenetikteki kullanımı

Çoklu dizi hizalamaları filogenetik ağaç üretmekte kullanılabilir. Bunun iki nedeni vardır. Birincisi, açıklamalı (annotated) dizilerdeki işlevsel protein bölgeleri bilinmeyen protein bölgelerinin hizalanmasında kullanılabilir. Öbür neden ise işlevsel olarak önemli olan korunmuş bölgeler bu yolla bulunabilir. Çoklu dizi hizalamaları kullanılarak, diziler arasında homolojiden yararlanarak evrimsel ilişkiler bulunabilir. Nokta mutasyonlar ve delesyonlar (indel olarak adlandırılır) tespit edilebilir.

Çoklu dizi hizalamaları işlevsel olarak önemli konumların tespit edilmesinde kullanılabilir. Korunmuş bölgeler sayesinde örneğin, bağlanma bölgeleri, aktif bölgeler, veya diğer anahtar fonksiyonlara karşılık gelen konumlar bulunabilir. Çoklu dizi hizalamalarına bakarken, dizileri kıyaslamakta farklı özellikleri göz önüne almak yararlı olabilir. Bu özelliklerin arasında aynılık, benzerlik, ve homoloji sayılabilir. Aynılık, dizilerin birbirine karşılık gelen pozisyonlarında aynı kalıntıya (rezidüye) sahip olmasıdır. Buna karşın, benzerlik, karşılaştırılan dizilerin nitel olarak benzer kimyasal kalıntılara sahip olmasıdır. Örneğin, nükleotit dizilerinde, pirimidinler birbirine, pürinler de birbirine benzer sayılırlar. Benzerlik sonunda homolojiye varır, diziler ne kadar birbirlerine benzerse homolog olmaya o kadar yakındırlar. Dizilerde homoloji, ortak ataları bulmaya yardımcı olur.

Ayrıca bakınız

İnceleme makaleleri

  • Duret, L. (2000). "Multiple alignment for structural functional or phylogenetic analyses of homologous sequences". D. Higgins and W. Taylor (Ed.). Bioinformatics sequence structure and databanks. Oxford: Oxford University Press. 
  • Notredame, C. (2002). "Recent progresses in multiple sequence alignment: a survey". Pharmacogenomics. 31 (1). ss. 131-144. doi:10.1517/14622416.3.1.131. 
  • Thompson, J. D. (1999). "A comprehensive comparison of multiple sequence alignment programs". Nucleic Acids Research. 27 (13). ss. 12682-2690. doi:10.1093/nar/27.13.2682. PMID 10373585. 
  • Wallace, I.M. (2005). "Multiple sequence alignments". Curr Opin Struct Biol. 15 (3). ss. 261-266. doi:10.1016/j.sbi.2005.04.002. 
  • Notredame, C (2007). "Recent evolutions of multiple sequence alignment algorithms". PLOS Computational Biology. 8 (3). s. e123. doi:10.1371/journal.pcbi.0030123. 

Dış bağlantılar

Lecture notes, tutorials, and courses


Новое сообщение