Figwise
ブログに戻る
クラドグラム vs 系統樹:両方の正しい読み方

クラドグラム vs 系統樹:両方の正しい読み方

2つを見分ける3つのチェックポイント:スケールバー、先端の整列、メソッドライン。その上で、ノード、姉妹群、外群、支持率を正しく読み取る。

FigwiseFigwiseチーム

クラドグラムと系統樹は、まったく同じ分岐パターンを示すことができます。違いは枝にあります。クラドグラムでは、枝の長さはまったく情報を持ちません。スケールされたツリーでは、枝の長さはデータです——遺伝的変化または時間のいずれかです。

その1つのルールが、図から主張できることの限界を決めます。このテーマに関するほとんどのページはそこで止まっており、いくつかは残りの部分を間違えています。クラドグラムは形質から作られ、系統樹はDNAから作られると言うのです。しかし、どちらもどちらのデータからも構築できます。

代わりに、役に立つ部分を紹介します。目の前にあるのがどのツリーかを判別する3つのチェック、それを読み取る4つのステップ、そして試験の解答や論文の草稿で最もよく見られる6つの誤読です。

1つのルールによる違い

枝の長さは意味を持つか、持たないかのどちらかです。他のすべてはそこから導かれます。

クラドグラム フィログラム クロノグラム(時間ツリー)
枝の長さ 意味なし 変化の量 経過時間
スケールバーまたは軸 なし "0.05 置換/サイト" "Ma"、"Myr"、年
先端 すべてが1本の線上に揃っている 不揃い すべてのサンプルが現在のものであれば揃い、サンプルに日付があればずれる
主張できること 分岐順序のみ 分岐順序と変化の量 分岐順序と日付

T. Ryan Gregoryによるオープンアクセスの入門書は、クラドグラムのルールを率直に述べています。「クラドグラム上の個々の枝の長さは、いかなる情報も伝えません。」対照的に、フィログラムは枝の長さを「何らかの発散の尺度に比例する」ものとして示し、「通常はスケールバーを含みます」。

その情報源が発散として数えているものに注意してください。DNA配列の比較または物理的特徴の比較です。つまり、データの種類は分ける線ではありません。

骨の測定から作られた節約法のツリーはフィログラムになり得ます。ゲノムから作られたツリーは、素のクラドグラムとして描かれ得ます。重要なのは、描いた人が枝をスケールしたかどうかです。

手にしているのがどれかを判別する3つのチェック

これらを順番に実行してください。10秒で、その図が何を伝えてよいかがわかります。

  1. スケールバーまたは軸を探します。 0.05 と書かれた短いバーは、サイトあたりの置換数を意味します。MaまたはMyrの軸は時間を意味します。バーも軸もない場合は? その図をクラドグラムとして扱い、量については何も主張しません。
  2. 先端を見ます。 先端が不揃いなら、枝は何かにスケールされています——バーが置換数を示していれば変化、軸が年を示していれば日付です。先端が揃っている場合は、クラドグラムか、現在のサンプルの時間ツリーのどちらかです。したがって、この2つを区別するにはチェック1がまだ必要です。
  3. キャプションの方法の行を読みます。 「最尤法、GTR+G、1000回のブートストラップ複製」は、実際の枝の長さを持つツリーを表します。「12本の同等に節約的なツリーの厳密コンセンサス」は、通常、トポロジーのみを見ていることを意味します。

チェック2は、人々が両方向に間違えるところです。先端が揃っていると「長さの情報がない」ように感じますが、現生種の時間ツリーも先端が揃っています。なぜなら、すべてのサンプルが現在のものだからです。また、先端が不揃いでも、必ずしもフィログラムを意味するわけではありません。化石較正されたツリーや、異なる日付に収集されたサンプルのツリーは、時間単位で先端がずれます。それを決定づけるのはスケールです——サイトあたりの置換数か、年かです。

同じ5種の霊長類のトポロジーを示す2つのパネル。パネルAは、すべての先端が揃い、スケールバーがないクラドグラムです。パネルBは、先端が不揃いで、0.05 置換/サイト と読めるスケールバーがあるフィログラムです。

同じトポロジー、2つの描画。両方のパネルは、この記事のために私が5つのRefSeqミトコンドリアゲノムのチトクロムbコード配列から構築した1つの近隣結合法ツリーに由来します。ヒト(NC_012920.1)、チンパンジー(NC_001643.1)、ゴリラ(NC_011120.1)、オランウータン(NC_002083.1)、アカゲザル(NC_005943.1)です。距離はJukes-Cantor補正済みです。根はアカゲザルの枝の中点にあります。

スケールされた枝が実際に数えているもの

フィログラムの単位は通常、サイトあたりの置換数です。0.05のバーは、整列された位置100ごとに約5つの変化を表します。2つの先端間の合計発散を求めるには、一方の先端から共有祖先まで下り、もう一方の先端まで上る経路上のすべての枝を合計します。

実際の図でその計算をする前に、2つの注意事項があります。下の表のパーセンテージは生の差であり、描かれた枝はJukes-Cantor補正されているため、両者は一致しません。また、ここでの根はアカゲザルの枝の中点にあり、その枝を図の上で半分に分割しています。

上の図の背後にある実際の数値は次のとおりです。チトクロムb遺伝子は、5種すべての霊長類で1,141塩基の長さであり、整列させるギャップはありません。

ペア 異なるサイト(1,141中) パーセント
ヒト vs チンパンジー 132 11.6%
ヒト vs ゴリラ 142 12.5%
チンパンジー vs ゴリラ 137 12.0%
ヒト vs アカゲザル 241 21.1%

その表から2つのことがわかります。ヒトとチンパンジーが最も近いペアであり、これは受け入れられている分岐順序と一致します。

また、パネルBのヒトの枝(0.069)はチンパンジーの枝(0.057)よりも長いため、この遺伝子は分岐以降、私たちの側でより多くの変化を蓄積してきました。これはフィログラムからのみ行える主張です。パネルAは同じトポロジーを持ちますが、それを裏付けることはできません。

時間ツリーは逆の働きをします。ノードに日付を置き、速度の違いを隠すため、「この2つは約600万年前に分岐した」と読むことはできますが、「この系統はより速く変化した」と読むことはできません。速度は系統間で異なるため、フィログラムの枝の長さを経過時間として読むことは決してしないでください。

任意のツリーを4つのステップで読む

1. 根を見つけ、次に外群を見つける

根は図の中で最も深い点であり、関係の網を歴史に変えるものです。ツリーは外群によって根付けられます。外群とは、関心のある集合の外側に位置するが、整列できるほど近いグループです。Gregoryの入門書は、外群種が「進化ツリーを根付けるために必要である」と述べています。

グループの外側に明確にある最も近い近縁種を選びます。近すぎるとグループ内に属してしまいます。遠すぎると、その長い枝が根を間違った場所に引きずります。私の図では、アカゲザルが4つの類人猿に対してこの役割を果たしています。

表現について1つの注意事項があります。外群への枝はしばしば「basal(基部の)」と呼ばれますが、Gregoryはそれに反対しています。読者がそれを原始的または祖先的と解釈するからです。アカゲザルは、そのツリー上の他の何かの祖先ではありません。それは、同じくらいの歴史を背後に持つ現生種です。

2. 内部ノードを種ではなく祖先として読む

各内部ノードは、2つに分かれた1つの祖先集団です。それは、その子孫のどちらかではありません。この誤りの古典的な例:クジラとカバは姉妹群ですが、それはクジラの祖先がカバであることを意味しません。Pakicetus(パキケトゥス)のような初期のクジラの化石は、カバとはまったく似ていません。

同じ論理が、ヒトとチンパンジーに関する使い古された疑問に答えます。私たちはチンパンジーから進化したわけではありません。私たちは彼らとノードを共有しています。

3. 姉妹群を特定する

2つの先端が、他の何も合流しないノードで出会うとき、それらは姉妹群です。図では、ヒトとチンパンジーが姉妹です。ゴリラは、ヒトとチンパンジーのペア全体の姉妹であり、どちらか一方だけの姉妹ではありません。

関連性をノードの用語で声に出して言うと、ほとんどの混乱は消えます。より最近の共有ノードを持つペアが、より近い関連性を持つペアです。バークレーのUnderstanding Evolutionは、そのルールを「共通祖先は進化的関連性の通貨である」と述べています。

4. ノードを信頼する前にサポート値を確認する

枝の横にある数値は、その枝がどの程度再現可能であったかを示し、どれほど古いか、どれほど正しいかを示すものではありません。閾値は、それらを生み出した方法に依存し、互換性はありません。

  • **標準ブートストラップ(BS)**は保守的に働きます。ultrafast bootstrap論文では、標準ブートストラップ値80%はすでに0.95の正解確率を持ち、著者らは80%以上の分岐を信頼することは広く受け入れられていると述べています。より古く緩い経験則である70%は、Systematic Biology 42:182–192 におけるHillis and Bullの1993年のテストに遡ります。
  • **Ultrafast bootstrap(UFBoot)**はほぼ不偏であるため、同じ枝に対して数値が高くなります。IQ-TREE FAQは、「サポートが95%以上の場合にのみ枝を信頼し始めるべき」と述べ、BS%とUFBoot%を直接比較すべきではないと警告しています。
  • SH-aLRTはUFBootと組み合わせます。同じページは80%以上を提案し、SH-aLRT ≥ 80%かつUFBoot ≥ 95%の場合に枝を確実なものとして扱います。
  • ベイズ事後確率は0から1の範囲で、0.95が通常の基準です。注意して読んでください。Suzuki, Glazko and Neiは、これらの値が高すぎることがあると示しました。

ノードに数値がない場合、その図はサポートについて何も伝えていません。それに基づいて議論を構築しないでください。

必要な用語、それぞれ1行で

  • クレード — 1つの祖先と、そのすべての子孫(現生と絶滅を含む)。
  • 単系統群 — クレード。欠けているものも、余分なものもありません。
  • 側系統群 — 1つの祖先と一部の子孫。鳥類を含まない「爬虫類」が標準的な例です。
  • トポロジー — 長さを除いた分岐パターンのみ。
  • 多分岐 — 2つではなく3つ以上の子孫系統を持つノード。通常、データが順序を解決できなかったことを意味します。
  • 枝サポート — ブートストラップ値など、枝に付随する再現性スコア。

ツリーが誤読される6つの方法

これを、図を自分で読む際のチェックリストとして使用してください。

  1. 先端を横に読む。 カエルが魚とヒトのどちらに近いか尋ねられたとき、ほとんどの読者は隣にある魚を選びます。間違いです。カエルとヒトはどちらも四足動物であり、どちらも真骨魚類と等しく関連しています。先端の順序は無意味です。なぜなら、すべてのノードは自由に回転できるからです——Gregoryはツリーをベビーモビールに例えています。
  2. 左から右への進歩。 ツリー上の何かが他の何かより進歩しているということはありません。バークレーのツリー、はしごではないページは、その習慣を存在の大いなる連鎖に遡り、どの系統が左に描かれるかは恣意的であると指摘しています。
  3. 現生種を互いの祖先と見なす。 通常のツリーのすべての先端は同時代のものです。どれも別のものを生じさせてはいません。
  4. ノードを数えて関連性を順位付けする。 ノード数は、分類群を追加または削除すると変わります。バークレーの具体例:サメを追加するまでは、両生類と棘皮動物を隔てるノードは3つですが、追加すると4つになります——実際の関連性は変わっていないのに。
  5. 長い枝を「何も起こらなかった」と読む。 ノードのない長い枝は、記録された分岐がない1つの系統を意味し、進化を止めた系統を意味するわけではありません。逆の誤りも同様に一般的です。変化はノードでのみ起こるわけではありません。
  6. クラドグラム上の間隔を読む。 大きいギャップ、小さいギャップ、長い枝、短い枝——クラドグラムでは、そのどれもデータではありません。

練習に使える実際のツリー

  • **NextstrainのSARS-CoV-2ビルド**には、TIMEとDIVERGENCEの2つの設定があるBranch Lengthスイッチがあります。それを切り替えると、1つのトポロジーが時間ツリーとして、次にフィログラムとして再描画されるのを見られます。違いを感じる最も速い方法です。
  • **Gregoryの図8**は、1つのトポロジーをクラドグラム、フィログラム、超距離ツリーとして並べて示し、その理由を詳しく説明しています。
  • **NCBIのCommon Tree**は、NCBIの分類法を使用して種リストからツリーを構築します。分類法には枝の長さがないため、出力されるのはトポロジー——クラドグラムです。
  • **TimeTree**はもう1つの質問に答えます。2種のペアについて発表された発散日付を返すため、これはクロノグラムの領域です。

では、どれを描くべきか?

図のキャプションの主張に合うツリーを描いてください。

  • イベントの順序のみ — クラドグラムは正直で読みやすいです。
  • 1つの系統がより多く変化した — スケールされた枝とスケールバーが必要です。
  • 分岐の日付 — 時間軸と、あなたの議論を支えるノード上のサポート値が必要です。

どれを選んでも、仕組みは同じ3つの入力です。トポロジー、任意の枝の長さ、ラベルです。当社の系統樹作成ツールは、Newick文字列またはプレーンな種リストを受け取り、SVGまたはPNGをエクスポートします。長さなしのNewickを入力すると、真のクラドグラムが得られます。先端が揃い、スケールバーがなく、データが裏付けないものは何も暗示されません。ツリーがサマリー図の1つのパネルになる場合は、グラフィカルアブストラクト作成ツールがそのレイアウトを処理します。

提出前に決めておくことが1つあります。図の一部がAIツールから生成された場合は、対象ジャーナルが開示を求める内容を確認してください。現在のルールをAI生成の図とジャーナルのポリシーにまとめました。

FAQ

クラドグラムは系統樹ですか?

クラドグラムは系統樹の一種です——分岐順序のみを示す種類です。多くの生物学者はこれらの言葉を同じ意味で使います。だからこそ、キャプションのラベルを信頼する代わりに、上記の3つのチェックを実行する価値があるのです。

クラドグラムは時間を示しますか?

いいえ。枝の長さも、間隔も、先端の順序も示しません。軸もスケールバーもない図は、時間や変化の量について何も主張しません。

外群はどのように選びますか?

誰もがあなたの内群の外側にあると同意し、確実に整列できる最も近いグループを選びます。その後、それが内群の内側に出てこなかったことを確認してください。もし内側に出てきたなら、あなたの内群はあなたが考えていたものではなかったということです。

ブートストラップ値はどれくらいあれば十分ですか?

標準ブートストラップでは、80%以上が通常の基準であり、70%はより古く弱い基準です。ultrafast bootstrapでは95%を使用してください。UFBootの数値と標準ブートストラップの数値を同じスケールに載せることは決してしないでください。

2つの種が先端で隣り合っています。それらは近縁ですか?

必ずしもそうとは限りません。任意のノードを回転させると、ツリーは同一のまま先端の順序が変わります。両方の先端を、それらが出会うノードまで下ってたどり、そのノードを代替案と比較してください。それが唯一のテストです。