他力code
Blog
ブログ記事一覧

カテゴリで絞り込み

タグ

全67件の記事

Claude Opus 5登場:IMO 2026で42点満点の金メダル級、SWE-bench Verified 96.0%をFable 5の半額で

Anthropicが2026年7月24日、Claude Opus 5を公開。入力100万トークン5ドルとFable 5の半額に据え置きつつ、SWE-bench Verified 96.0%、IMO 2026で42点満点を記録。System Cardの数値から実力と弱点を検証する。

続きを読む

FLUX 3登場:Black Forest Labsが動画・音声・ロボット制御を統合するマルチモーダル基盤モデルを発表、Audiの工場で実タスク検証へ

画像生成モデルFLUXで知られるBlack Forest Labsが2026年7月23日、画像・動画・音声を単一アーキテクチャで学習する新モデル「FLUX 3」を発表。ロボット制御にも拡張でき、提携先mimic roboticsとの実装がAudiの工場で実際の生産タスクを対象にテスト・展開されている。

続きを読む

Inkling登場:Thinking Machines初モデルは975BをApache 2.0で無償公開、"最強を狙わない"戦略で勝負

元OpenAI CTOミラ・ムラティ氏のThinking Machinesが2026年7月15日、初の自社モデル「Inkling」を発表。975B(アクティブ41B)のマルチモーダルMoEをApache 2.0で完全公開し、微調整基盤Tinkerで収益化する戦略を検証する。

続きを読む

Kimi K3登場:2.8兆パラメータ"史上最大のオープンモデル"がOpus 4.8級をSonnet 5価格で狙う

Moonshot AIが2026年7月16日に発表したKimi K3を検証。2.8兆パラメータ・1Mコンテキストの史上最大級オープンウェイトモデルは、自己申告でOpus 4.8超え、価格はSonnet 5と同水準の$3/$15。7月27日までの重み公開予告と注意点も整理する。

続きを読む

Grok 4.5登場:SpaceXAIの"Opus級"モデルはタスク単価約$2.5、Fable 5の5分の1で動く

SpaceXAIが2026年7月8日に発表したGrok 4.5を検証。入力$2/出力$6・500Kコンテキストの"Opus級"モデルは、独立評価でコーディングタスク単価約$2.5とFable 5の5分の1。自己申告ベンチマークの読み方と提供範囲も整理する。

続きを読む

Claude Sonnet 5登場:SWE-bench Verified 85.2%、標準価格据え置きでFree/Proの新デフォルトモデルに

Anthropicが2026年6月30日に公開したClaude Sonnet 5は、SWE-bench Verified 85.2%を達成しFree/Proの標準モデルに採用。標準価格は据え置きのまま、エージェント性能をOpus級に近づけた変更点をシステムカードの一次データで検証する。

続きを読む

Research Insight | ChatGPTは「先進国男性のツール」ではなかった:OpenAI Signalsが暴く普及の実像

OpenAIが2026年6月30日に公開したSignalsデータ分析によると、ChatGPTの成長を牽引しているのはアフリカ・アジアの低HDI国と、ブラジルやナミビアなど一部地域における女性名ユーザーの利用量だった。一次データで実態を検証する。

続きを読む

GPT-5.6 Sol/Terra/Luna登場:Terminal-Benchで最高水準、米政府が「顧客単位」で出荷に関与

OpenAIがGPT-5.6 Sol・Terra・Lunaの3階層を限定プレビュー公開。公式はSolがTerminal-Bench 2.1で最高水準と説明(報道では91.91%)。だが米政府の要請でアクセスは承認済みパートナーに限定(報道では約20社)。商用AIに政府が顧客単位で関与する初の事例を解説する。

続きを読む

SpaceXがCursorを6兆円超で買収合意:IPO4日後の電撃、VC系スタートアップ史上最大級の買収が示すAIコーディング覇権争い

2026年6月16日、SpaceXがAIコーディング大手Cursor(Anysphere)を約600億ドルの全株式で買収すると発表。IPOのわずか4日後、主要報道ではVC系スタートアップ買収として史上最大級と位置づけられる。2月のxAI統合からの流れと、Anthropic・OpenAIが先行するAIコーディング市場での覇権争いを整理する。

続きを読む

GLM-5.2の衝撃:MITオープンウェイトで長期コーディングのGPT-5.5を上回り、出力コストは約6〜7分の1の中国製モデル

Z.ai(Zhipu)が2026年6月13日にGLM-5.2を発表、オープンウェイトはその後Hugging Face等で公開。753B/40BのMoEをMITライセンス提供し、SWE-bench ProでGPT-5.5を上回りながら出力単価はその約6〜7分の1。第三者のArena系ランキングでも上位。性能・価格・1Mコンテキスト、そして中国企業API利用に伴う法域・ガバナンス上の論点を整理する。

続きを読む

Claude Fable 5登場:SWE-Bench Pro 80.3%でOpus 4.8に+11.1pt、「Mythos級」AIが安全分類器つきで一般公開へ

Anthropicが2026年6月9日、Mythos級の能力を持つClaude Fable 5を一般公開。SWE-Bench Pro 80.3%でOpus 4.8を11.1pt上回り、価格は$10/$50。高リスク判定時はrefusalを返しフォールバック設定でOpus 4.8に回せる安全設計を解説する。

続きを読む

Microsoftが自社AI「MAI」7モデルを公開:MAI-Code-1-FlashがHaiku 4.5をSWE-Bench Proで+16pt、脱OpenAI依存が本格化

MicrosoftがBuild 2026で自社開発AI「MAI」7モデルを発表。コーディング用MAI-Code-1-FlashはSWE-Bench ProでHaiku 4.5を+16pt上回り最大60%トークン削減。GPT依存を脱する自前知能戦略を解説。

続きを読む