NEWS (4)
ニュース
2026/7/10
OpenAI「GPT-5.6」登場!最上位『Sol』が Fable 5 に1点差まで肉薄、しかも61%速くて半額——3兄弟モデルをてんびん丸が解説するよ
OpenAI が 2026年7月9日、新モデル群『GPT-5.6』を一般公開したよ。最上位の『Sol』、中位の『Terra』、下位の『Luna』の3グレード構成で、Sol は総合指標 Intelligence Index v4.1 で 58.9点。Anthropic の Claude Fable 5(59.9点)にわずか1点差まで迫りながら、所要時間は61%短く、推定コストは約半分をうたうんだ。ただし SWE-Bench Pro では Fable 5 に負けるなど、得意分野はハッキリ分かれてる。3兄弟モデルの性能・料金・使い分けを、てんびん丸が捏造ナシでやさしく整理するよ。
2026/6/13
AIの“賢さ”って誰がどう測ってるの?Ai2が開発の裏側を支える『olmo-eval』を公開したよ——てんびん丸が整理するんだ
AIの研究機関Allen Institute for AI(Ai2)が2026年6月12日、大規模言語モデルを評価するためのオープンソース道具『olmo-eval』を公開したよ。完成したAIの点数を出すだけじゃなく、“開発の途中”で何度もテストし続けるための作業台なんだ。ツールを使うエージェントの能力や、対話の多いやりとりまで評価できて、同じテストを問題1問ずつ見比べられるのが特徴。GitHubで誰でも入手できるよ。ChatGPTやClaudeの『賢さ』って誰がどうやって測ってるの?という素朴な疑問を、てんびん丸が初心者向けにやさしく整理するよ。
2026/5/14
AIの『長時間タスク能力』、業界予想を吹き飛ばす伸び!MythosとGPT-5.5が『16時間タスク』ラインに突入したよ
ITmediaが2026年5月14日に伝えた話題。米METRと英AISIの最新評価で、Anthropic『Claude Mythos Preview』とOpenAI『GPT-5.5』が長時間タスク遂行能力で従来予想を大幅超過。50%タイムホライズン16時間以上、80%タイムホライズンも4.7カ月ごとの倍増ペースを超えた事実を、てんびん丸が整理するよ。
2026/5/6
Hugging Face、ASRリーダーボードに『ベンチマクサー忌避剤』を投入。ズル対策が一段階えぐくなったよ
音声認識ベンチマーク Open ASR Leaderboard が、Appen と DataoceanAI の非公開データセット11本(約30時間)を導入。ベンチマーク特化のチューニングを締め出して、本物の精度勝負に持ち込む新方式を解説。