AI工具排名情况
有什么网址可以不断跟踪当下比较热门的最新模型?
| 用途 | 网站/平台 | 适合看什么 | ||
|---|---|---|---|---|
| 综合能力、人类偏好排名 | LMArena(https://huggingface.co/spaces/lmarena-ai/arena-leaderboard?utm_source=chatgpt.com) / Arena Leaderboard | 看 GPT、Claude、Gemini、DeepSeek、Qwen 等模型在真实用户投票中的排名,适合判断“大家实际用起来觉得谁更强”。它覆盖 text、image、vision 等榜单。(Hugging Face) | ||
| 模型性能、价格、速度对比 | Artificial Analysis | 非常适合看“哪个模型性价比高”,它会比较智能水平、价格、速度、延迟、上下文窗口等。(Artificial Analysis) | ||
| 开源模型热度 | Hugging Face Models / Trending | 看最新开源模型、下载量、社区热度、模型卡、权重发布。尤其适合跟踪 Qwen、DeepSeek、GLM、Llama、Mistral 等开源/开放权重模型。(Hugging Face) | ||
| API 可用性、价格、模型菜单 | OpenRouter Models | 看哪些模型已经能通过 API 调用、价格多少、上下文长度多少。OpenRouter 官方文档也说明它提供统一 API,可以访问数百个 AI 模型。(OpenRouter) | ||
| 防止“榜单污染”的客观评测 | LiveBench | 更偏客观能力测试,强调降低测试集污染,并且会持续更新问题,适合判断模型真实推理、数学、代码、数据分析能力。(LiveBench) | ||
| 编程/修 bug 能力 | SWE-bench | 如果你关心 Codex、Claude Code、Cursor、Copilot 这类编程能力,就看 SWE-bench。它用真实 GitHub issue 来评估模型/Agent 修复代码的能力。(SWE-bench) | ||
| 代码编辑能力 | Aider LLM Leaderboard | 看模型在“根据自然语言修改代码、让测试通过”这类任务上的表现,适合判断哪个模型更适合写代码。(Aider) | ||
| 长期趋势、模型数据库 | Epoch AI Models Database | 更适合研究模型演进趋势,比如发布时间、参数量、训练算力、机构等,不是每日热榜,但适合做系统跟踪。(Epoch AI) | ||
| 中文/国内开源生态 | ModelScope 魔搭社区 | 看国内模型、中文模型、多模态模型、应用部署,比较适合跟踪 Qwen、通义、智谱、魔搭生态里的模型。(魔搭社区) |
All articles on this blog are licensed under CC BY-NC-SA 4.0 unless otherwise stated.