Ornith 1.5はどの程度進化した?〜1.0と1.5を3つの物差しで測って比べた

本ページは広告(アフィリエイトプログラム)を含みます。詳しくはプライバシーポリシーをご覧ください。

8月末にOrnith 1.5がリリースされました。Ornith 1.0 が6月にリリースされたところと考えると、とても早い間隔での登場です。この二つのモデルに、どれくらいの違いがあるのでしょうか。

新版は、全項目で性能が向上したと公表されていますが、ファイルサイズもほぼ同じ、9Bと、35Bの2組について、実測でその差が見えるのかどうか、動かしてみました。

2026年9月時点の実測です。

Ornith とは?

Ornith は、DeepReinforce という会社が公開しているオープンソースのLLMです。1.0 が2026年6月21日、1.5 が8月18日に公開されました。MITライセンスの形式を取っており、地域の制限はなく、商用利用も可能です。

特徴として配布元が挙げているのは、次の3つです。

用途コードを書く「エージェント」向け。ターミナルを操作したり、道具を呼び出したりして作業を進めることを想定している
土台ゼロから作ったものではなく、Gemma 4 と Qwen 3.5 の上に追加の学習を重ねたもの
作り方答えだけでなく、答えにたどり着くための段取りそのものも学習させるという仕組み

3つめが、このシリーズの売りにあたる部分です。ふつうは人が問題と解き方の枠組みを用意してモデルに解かせますが、Ornith はその枠組みのほうもモデルに考えさせて、両方まとめて良くしていくと説明されています。1.5 ではさらに踏み込んで、問題そのものをモデルに作らせるところまで広げたとのことです。

出ている大きさは、1.0 が 9B・31B・35B・397B の4種類。1.5 では31B が無くなり、9B・35B・397B の3種類になりました。今回比べる 9B は密なモデル、35B は MoE です。

なお 1.5 の 9B には、スマートフォン向けに1.5GBまで小さくした版も用意されています。

Hugging Face の数字では、1.0-9B が101万、1.5-35B が36万ダウンロードされています。(2026年9月23日時点)。1.5 が出て1か月ほど経ちますが、旧版のほうがまだ多く落とされています。

比較したこと

比べたのは9B と 35B の2組です。

モデル 公開 構成 量子化
Ornith-1.0-9B 2026年6月21日 Q4_K_M
Ornith-1.5-9B 2026年8月18日 Q4_K_M
Ornith-1.0-35B 2026年6月 MoE Q4_K_M
Ornith-1.5-35B 2026年8月 MoE Q4_K_M

物差しは3つ用意しました。

①速さ 読む速さと書く速さ。当方が測った
②賢さ(43問) コード生成・仕様の罠・言えないことを言わない度合いなど
③確信度の当たり方(20問) 「80%」と言ったとき、本当に80%当たるのか

①の条件は次のとおりです。

機体 GMKtec EVO-X2(Ryzen AI Max+ 395・ユニファイドメモリ128GB)
GPU 内蔵の Radeon 8060S に固定
実行するもの llama.cpp(ビルド b10941)・Vulkan
指標 pp512(512トークン読ませる速さ)/ tg128(128トークン書かせる速さ)[tok/s]
回数 1条件につき5回。並べ替えて上下の外れを1つずつ落とし、中央3点の中央値

速さについて(実測)

モデル 読む速さ pp512
[tok/s]
書く速さ tg128
[tok/s]
Ornith-1.0-9B 1,078.0 38.3
Ornith-1.5-9B 997.3 37.9
Ornith-1.0-35B 1,146.5 74.0
Ornith-1.5-35B 1,122.8 73.2

tok/s は1秒あたりのトークン数で、読ませる速さと書き出す速さを表します。新版のほうが、わずかに遅くなっています。書く速さで約1%、読む速さで9Bは7.5%落ちました。

9B でも 35B でも同じ傾向を示しています。少なくとも「新版は速くなった」とは言えません。

なぜ遅くなったのか、中身を覗いてみました。すると1.5 では層が1つ増えていました。

モデル層の数 [層]パラメータ [個]
Ornith-1.0-9B3289.5億
Ornith-1.5-9B3392.0億
Ornith-1.0-35B40347億
Ornith-1.5-35B41355億

層というのは、文章を処理する工程の段数だと思ってください。入ってきた文章が1段目、2段目……と順に通っていき、最後に答えが出てきます。工場の流れ作業に近いものです。段が増えれば、通り抜けるのに時間がかかります。

つまり 1.5 は、中身を少しだけ作り変えてあります。追加で学習させただけではなく、構造そのものに手が入っているわけです。

増えた1層が何なのかも調べました。複数の単語をまとめて先読みするための層で、本来は速くするために付いているものです。ところが手元で動かしたときの記録を見ると、こう出ていました。

model has unused tensor blk.32.nextn.eh_proj.weight -- ignoring

「使わない部品なので無視する」という意味です。llama.cpp はこの層を読み込みはするものの、使っていません。

ここで速さの話がつながります。使われない層のぶんだけパラメータが増えているので、そのぶん遅くなる。約1%という差は、これで説明が付きそうです。他の道具で動かせば、この層が働いて逆に速くなる可能性もありますが、そちらは試していません。

配布元が出している賢さについて

配布元のモデルカードには、1.0-9B と 1.5-9B を直接並べた表が載っています。15項目すべてで新版が上です。

ただ、項目の名前だけ並べられても何のことか分かりません。ここで出てくるのは、AIの賢さを測るために世の中で使われている試験です。それぞれ測っているものが違います。

試験の名前何を測るものか種類
BrowseCompウェブを自分で見て回って調べ物をさせる。簡単には見つからない情報を探し当てられるか作業
Toolathlon-Verified実在のソフトを相手に、道具を何度も使いながら長い作業をやり切れるか作業
NL2Repo仕様書だけを渡して、プログラム一式をゼロから作らせる。空の作業場から、構成を自分で決め、必要な部品をそろえ、実際に導入できる形まで仕上げさせる。104問作業
MCP-Atlas36種類の実在するサーバーと220個の道具を渡し、どれを使うか自分で選ばせる。1,000問作業
SWE-bench ProGitHub にあった不具合を直させる試験の、大きく複雑なプログラムを対象にした難しい版作業
GPQA Diamond大学院レベルの理科の問題198問。専門家は65%、専門外の人はウェブで調べても34%という難しさ知識
HLE(道具なし)人類最後の試験という名前の通り、100を超える分野の最難問2,500問。上位のAIでも点が取りにくい知識
SWE-bench VerifiedGitHub に実際にあった不具合の報告を読み、直すための修正を書かせる。人手で問題文と試験を検証した版作業

右の列で分けたとおり、「知識」は GPQA Diamond と HLE の2つだけです。残りの6つは、道具を使って作業をやり切れるかを見ています。前者が知識と考える力、後者が仕事を任せる力にあたります。この表は次のスコア表と同じ順に並べてあります。

NL2Repo については補足があります。この試験を作った論文によると、最も強いAIでも試験の通過率は4割に届かず、一式を正しく作り切れることはほとんどないとのこと。途中で勝手に終わらせる、全体の筋を見失う、ファイルどうしの繋がりが壊れる、といった失敗が挙げられています。1.5 の 32.4 という数字は、その中では健闘している部類です。

項目 1.0-9B
[スコア]
1.5-9B
[スコア]

[ポイント]
BrowseComp 44.8 56.4 +11.6
Toolathlon-Verified 33.4 41.2 +7.8
NL2Repo 27.2 32.4 +5.2
MCP-Atlas 49.4 54.2 +4.8
SWE-bench Pro 42.9 47.5 +4.6
GPQA Diamond 82.5 86.4 +3.9
HLE(道具なし) 16.8 20.2 +3.4
SWE-bench Verified 69.4 70.6 +1.2

スコアは配布元が載せている値をそのまま写したものです。単位の記載はありませんが、数字が大きい方が性能が高いと読み取れます。

この分類で表を見直すと、偏りがはっきりします。大きく伸びたのは BrowseComp・Toolathlon・MCP-Atlas で、どれも「道具を使って作業をやり切る」側です。一方、コード修正の定番である SWE-bench Verified は +1.2 とほとんど動いていません。同じ「賢くなった」でも、伸びたのは調べ物と段取りのほうだったと読めます。

ただしこれらはすべて配布元による自己申告で、第三者が同じ結果を再現したという報告は見当たりませんでした。だから手元で確かめたい、というのがこの記事の動機です。

独自テストの測定結果

次に、賢さを測るために準備した、当方の独自テストを行いました。コード生成7問・仕様の罠6問・答えられない質問に答えてしまわないか18問・答えられる質問にきちんと答えるか12問という組です。

指標 1.0-9B 1.5-9B 1.0-35B 1.5-35B
コード生成 [正解した数/問] 7/7 7/7 7/7 7/7
仕様の罠 [正解した数/問] 6/6 6/6 6/6 6/6
答えられる質問への的中率 [割合・1.0=全問正解] 1.0 1.0 1.0 1.0
コードの出来 [点/100点満点] 95.57 96.79 95.37 95.96
罠の出来 [点/100点満点] 95.63 98.48 94.63 97.71
誤答率 [割合・0に近いほど良い] 0.188 0.214 0.235 0.154

正答の数は、4本ともすべて満点でした。新旧で1問も違いません。

差が出たのは出来ばえの点数(+1〜3点)と誤答率だけです。そしてその誤答率が妙で、9B では悪くなり、35B では良くなっています。同じ新版なのに、大きさによって逆の結果が出ました。

誤答率は割合なので、0.188 は「判定できたうちの18.8%を間違えた」という意味です。しかもこの値は18問から出したもので、信頼できる幅を計算すると 1.5-9B が 0.076〜0.476、1.5-35B が 0.043〜0.422 でした。どちらも 1.0 側の幅と重なっています。優劣を言える差ではありません。

確信度は当てになるのか(実測)

3つめの物差しです。確信度という言葉から説明します。

AIに何かを答えさせるとき、その答えにどれくらい自信があるかを一緒に出させることができます。この自信の度合いを確信度と呼びます。「この答えで80%くらい合っていると思う」という数字です。

ここで、先にお断りしておきたいことがあります。

今回の確信度は、AIに「何%自信がある?」と聞いて答えさせたものではありません。AIは文章を書くとき、次にどの単語を置くかを確率で選んでいます。「はい」が0.8、「いいえ」が0.2、という具合です。その確率をそのまま読み取ったものが、ここでいう確信度です。

ですから、これは「次にどの単語を選ぶか」の確率であって、答えが正しい確率ではありません。計算された実在の数字ではありますが、正確さを保証するものではない、という点は押さえておいてください。

確信度が使えると便利です。90%以上なら自動で通し、50%なら人が見る、といった振り分けができます。ただしそれはその数字が当てになるならの話です。80%と言った答えが実際には30%しか合っていないなら、振り分けの基準になりません。

そこで、正解が分かっている20問を解かせました。サーバーのログを1行見せて、「緊急」「様子見」「無視」の3つから選ばせる問題です。答えと一緒に確信度も出させます。

見るところは2つあります。1つめは、そもそも何問当たったか。

モデル正答 [正解した数/20問]
Ornith-1.0-9B15/20(75%)
Ornith-1.5-9B17/20(85%)
Ornith-1.0-35B19/20(95%)
Ornith-1.5-35B16/20(80%)

これは単純に高いほど良い数字です。20問なので1問で5%動きます。新旧で比べると、9B は 15→17 と良くなり、35B は 19→16 と悪くなりました。ここでも大きさによって逆の結果です。

2つめが、確信度が当てになるかどうか。こちらは高いほど良いという数字ではありません。言った数字と実際が一致していれば良い、という見方をします。

20問を確信度の高さで仕分けて、それぞれの組で実際に何%当たったかを数えました。

モデル確信度の帯その帯に入った問数
[問]
AIが言った確信度
(平均)[%]
実際に当たった割合
[%]
1.0-9B50〜70%1257.1%91.7%
1.5-9B50〜70%1361.0%92.3%
1.0-35B50%未満1844.4%94.4%
1.5-35B50%未満1842.6%77.8%

表の読み方です。1行目なら、「57%くらい自信がある」と答えた12問のうち、実際には11問(91.7%)が正解だったということです。理想は左右の数字が近いことで、57%と言って57%当たる状態が「当てになる」にあたります。

結果は4本とも、言っている数字より実際のほうがずっと高い状態でした。特に 1.0-35B は「自信は半分以下」と言いながら、18問中17問を当てています。

生成AIは自信過剰だと言われることがありますが、この4本に限っては逆でした。控えめに申告して、実際にはよく当てている。もし「確信度が50%を切ったら捨てる」という使い方をすると、当たっている答えまで大量に捨ててしまいます。

結局、賢くなったのか

ここまでの結果を並べます。

測ったもの9B35B
配布元の15項目全項目で良くなった(新旧の比較表なし)
速さわずかに遅くなったわずかに遅くなった
43問の正答変わらない(満点)変わらない(満点)
43問の誤答率悪くなった良くなった
20問の正答良くなった悪くなった

良くなったところと悪くなったところが、両方あります。しかも9B で良くなった項目が 35B では悪くなっており、逆もあります。

この動き方は、ほぼ誤差の範囲と見るのが妥当です。20問なら1問で5%動きます。9B の「+10%」は2問ぶんでしかありません。誤答率も18問から出した値で、信頼できる幅が新旧で重なっています。良くなったとも悪くなったとも言えない大きさです。

速さについても同じです。書く速さの差は約1%で、使っていて気づく差ではありません。

つまり今回の測定で見る限り、賢さも速さも変化は見られませんでした。

ただし、これは「1.5 が 1.0 と同じもの」という意味ではありません。今回のテストで測れなかったところに、進化があるかもしれません。配布元が大きく伸びたと書いているのは、ウェブを見て回って調べる力や、道具を何度も使って長い作業をやり切る力です。その力は、当方の43問にも20問にも入っていません。

配布元が使っているのは、何百問・何千問という規模の課題です。数十問しか持たない側で同じ差を見ようとするほうに無理があります。

この記事で確かめていないこと

  • 配布元の15項目は自己申告をそのまま引いたもので、当方は再現していません
  • 43問と20問という規模では、数%の差は偶然と区別が付きません。有意かどうかの検定はしていません
  • 誤答率は18問から出した値で、信頼できる幅が新旧で重なっています。優劣の根拠になりません
  • 35B の新版は、20問のうち判定できなかったものが一部ありました
  • いずれも Q4_K_M という1つの刻みだけの比較です。別の刻みでは変わる可能性があります
  • 測定は内蔵GPU1台での値です。別の機体では違う数字が出ます
  • 確信度の測り方は当方が組んだもので、配布元が想定している使い方とは違うかもしれません

まとめ〜これから入れるなら、1.5 で良さそう

  • 1.0 の時点で、すでに十分に賢かった。賢さを測る43問は4本とも満点で、新旧に1問の差も出なかった
  • 速さもわずかに遅くなった程度で、書く速さの差は約1%。使っていて気づく差ではない
  • 当方のテストでは、差を出せなかった。問題が易しすぎて、満点同士を比べる形になっていた
  • 一方で配布元は、15項目すべてで 1.5 が上だと出している。伸びたのはウェブで調べる力や道具を使う力で、そこは今回のテストに入っていない
  • 中身が変わっていることは確かめられた。層が1つ増え、パラメータも増えている。追加学習だけでなく構造に手が入っている
  • 確信度の出方にも違いが出た。同じ問題でも、次の単語に付く確率の分かれ方が変わっている

これらを踏まえると、これから入れるなら 1.5 で良さそうです。

当方のテストで差が出なかったのは「1.5 が良くない」という話ではなく、1.0 がすでに満点を取れてしまう程度の問題しか用意できていなかったという話です。悪くなった証拠は出ていません。速さも実用上は同じです。

そのうえで、配布元は賢くなったと言っており、実際に中身も作り変えられています。増えた層は本来「速くするための仕組み」で、手元の道具ではまだ使われていませんでした。対応が進めば、こちらが有利になる可能性もあります。

ただしすでに 1.0 で動いている環境を、わざわざ入れ替える理由は見つかりませんでした。置き換えれば確実に速くなる、という結果ではないためです。新しく入れるなら 1.5、動いているならそのまま、というのが今回の結論になりそうです。

「新しい版が出た」と聞くと、乗り換えるべきか迷います。ただ今回のように、手持ちの問題が易しすぎると、差があっても見えません。満点が並んだ時点で、その物差しはもう使えていません。

1.0 と 1.5、どちらを入れるか

ここまでの結果から、選び方をまとめます。

こうしたいどちらか理由
これから新しく入れる1.5悪くなった材料が見つからず、配布元は良くなったと出している。新しいほうを選んで損はなさそう
すでに 1.0 で動いているそのまま 1.0入れ替えて良くなる結果が出ていない。手間をかける理由が無い
コードを書かせたいどちらでも手元の43問は両方満点で差が出ず。配布元の値でも定番の SWE-bench Verified は +1.2 とほぼ同じ
難しいコードの修正を任せたい1.5 寄り配布元の値で、難しい版の SWE-bench Pro は 42.9→47.5 と差が付いている(自己申告)
ウェブで調べさせたい・道具を使わせたい1.5 寄り配布元が大きく伸びたと出しているのがこの分野(自己申告・当方は未確認)
少しでも速く動かしたい1.01.5 は層が1つ増えたぶん、約1%遅い。ただし気づく差ではない
置き場所を節約したい1.09B で 5.24GiB と 5.38GiB。35B で 19.71GiB と 20.22GiB。差は0.5GiB程度

正直なところ、手元で測った範囲では 1.0 と 1.5 の差は分かりませんでした。賢さの43問は両方満点、速さの差は約1%です。どちらを選んでも、使っていて違いに気づくことはなさそうです。

ですので上の表は、「迷ったときにどちらへ倒すか」という程度のものだと思ってください。強く勧められるだけの差は、当方の測定からは出ていません。

なお大きさの選び方は、版とは別の話です。35B のほうが 9B より倍近く速いという結果が出ました(74.0 と 38.3 tok/s)。35B は MoE という作りで、1文字書くたびに中の一部しか使わないためです。20GB の置き場所を用意できるなら、35B のほうが快適です。

迷ったら、まず 1.5 の 9B を入れて、手元の仕事で試してみるのが早いと思います。今回のように、自分の用途で測ってみないと分からない部分があります。

速さは測れました。賢さの差は測れませんでした。測れなかったことも、測って初めて分かります。