有什么网址可以不断跟踪当下比较热门的最新模型?

用途 网站/平台 适合看什么
综合能力、人类偏好排名 LMArena(https://huggingface.co/spaces/lmarena-ai/arena-leaderboard?utm_source=chatgpt.com) / Arena Leaderboard 看 GPT、Claude、Gemini、DeepSeek、Qwen 等模型在真实用户投票中的排名,适合判断“大家实际用起来觉得谁更强”。它覆盖 text、image、vision 等榜单。(Hugging Face)
模型性能、价格、速度对比 Artificial Analysis 非常适合看“哪个模型性价比高”,它会比较智能水平、价格、速度、延迟、上下文窗口等。(Artificial Analysis)
开源模型热度 Hugging Face Models / Trending 看最新开源模型、下载量、社区热度、模型卡、权重发布。尤其适合跟踪 Qwen、DeepSeek、GLM、Llama、Mistral 等开源/开放权重模型。(Hugging Face)
API 可用性、价格、模型菜单 OpenRouter Models 看哪些模型已经能通过 API 调用、价格多少、上下文长度多少。OpenRouter 官方文档也说明它提供统一 API,可以访问数百个 AI 模型。(OpenRouter)
防止“榜单污染”的客观评测 LiveBench 更偏客观能力测试,强调降低测试集污染,并且会持续更新问题,适合判断模型真实推理、数学、代码、数据分析能力。(LiveBench)
编程/修 bug 能力 SWE-bench 如果你关心 Codex、Claude Code、Cursor、Copilot 这类编程能力,就看 SWE-bench。它用真实 GitHub issue 来评估模型/Agent 修复代码的能力。(SWE-bench)
代码编辑能力 Aider LLM Leaderboard 看模型在“根据自然语言修改代码、让测试通过”这类任务上的表现,适合判断哪个模型更适合写代码。(Aider)
长期趋势、模型数据库 Epoch AI Models Database 更适合研究模型演进趋势,比如发布时间、参数量、训练算力、机构等,不是每日热榜,但适合做系统跟踪。(Epoch AI)
中文/国内开源生态 ModelScope 魔搭社区 看国内模型、中文模型、多模态模型、应用部署,比较适合跟踪 Qwen、通义、智谱、魔搭生态里的模型。(魔搭社区)