「OpenAI、Gemini、Grokならどれが一番?」という質問をよく見ます。
自然な質問ですが、これらの名前は必ずしも同じLayerを指していません。
比較前に、
- Company
- Product / App
- Model Family
- Exact Model / Version
を分けると整理できます。
Company = Modelではない
OpenAIはCompanyです。GoogleもCompany、xAIもCompanyです。
一つのCompanyは、時間とともに複数のModelやProductを出します。
「OpenAIを使っている」だけでは、どのModel、API、Productか分かりません。
ProductはModel以外のLayerを持つ
Consumer Chat AppにはModel以外にも、
- System Instruction
- Memory
- Search
- File Handling
- Image Tool
- Account Limit
- Safety Policy
- UI
などがあります。
そのため、Underlying Modelが近くてもProduct Experienceは違います。
Model FamilyとExact Modelを分ける
GeminiやGrokのようなFamily Nameの中に、Speed、Cost、Context、Capabilityが違う複数Modelが存在することがあります。
ProviderはModelを更新します。
BenchmarkやCost計算では、Family NameだけでなくExact Model IDとDateを記録する方が正確です。
“Best Model”はTask次第
比較項目には、
- Reasoning
- Latency
- API Price
- Context Length
- Tool Support
- Multimodal Capability
- Coding
- Safety Behavior
- Region / Product Tier
などがあります。
長いCoding Taskに強いModelが、低CostなClassificationにも最適とは限りません。
Product比較はすぐ古くなる
AI CompanyはModel CatalogやFeatureを頻繁に変更します。
「Aはできる、Bはできない」という文章は短期間で古くなることがあります。
実際にProductを選ぶときは、その日のOfficial Documentation、Pricing、Model Pageを確認してください。
このLessonは永久Leaderboardではなく、比較方法を学ぶためのものです。
Chat ProductとAPIも同じではない
Web ProductではSearch、Memory、Image Generationなどが自動で組み合わされている場合があります。
Raw APIでは、それらを自分でToolとして接続する必要があるかもしれません。
逆にAPI側だけが細かいParameterやStructured Outputを提供することもあります。
比較表を作る
- Provider
- Exact Model ID
- Test Date
- Task
- Modality
- Latency
- Cost
- Success Criteria
を揃え、同じ代表Taskで試すと、Brand論争ではなくEngineering Decisionになります。
今日の一文
AIを比較するときは、Company、Product、Model Family、Exact Model Versionを分けて考えます。Appの名前だけではTechnical Specificationになりません。
次の第035回ではAI Securityへ入り、外部TextがAIのInstructionを乗っ取ろうとするPrompt Injectionを扱います。
コメント
質問、感想、補足したいことがあれば、ここに残せます。
まだコメントはありません。1Fになってみませんか。