模型广场108个模型
全部模型108
文本模型79
生图模型9
视频模型19
嵌入模型1
  • 低至8折
    MoonShot AI: Kimi K3
    kimi-k3
    Kimi K3 是 Kimi 迄今能力最强的旗舰模型,拥有 2.8 万亿参数,基于 KDA 混合线性注意力机制(Kimi Delta Attention)和注意力残差(Attention Residuals)技术构建,原生支持视觉理解,并拥有 100 万 token 上下文窗口。它是全球首个开源的 3 万亿级别模型,面向长程编程、知识工作和推理等前沿智能场景而设计。
    输入模态:
    输出模态:
    输入:
    ¥16/M¥20/M
    输出:
    ¥80/M¥100/M
    文本模型
  • Tencent: Hunyuan 3
    hunyuan-3.0
    Hy3 正式版面向真实业务场景打磨,采用 295B 总参数、21B 激活 MoE 架构,原生支持 256K 上下文,并提供no_think(极速响应)、think_low(快速思考)与 think_high(深度推理) 多档思考模式,兼顾极速响应、复杂推理与调用成本。相比 Preview 版本,Hy3 基于腾讯元宝、WorkBuddy、ima 、Marvis等真实业务反馈,重点提升了 Coding Agent、长文理解、多轮上下文承接、搜索问答与复杂任务执行能力,在减少幻觉、提升任务完成度和工程可用性方面表现更稳。更加适合前端任务、跨文件代码开发、长文档分析、办公自动化和多步骤 Agent 工作流等实用场景。
    输入模态:
    输出模态:
    输入:
    ¥1/M
    输出:
    ¥4/M
    SEO
    科技
    角色扮演
    市场
    法律
    +3
  • 低至8折
    Z.AI: GLM 5.2
    glm-5.2
    GLM-5.2 是智谱上线的面向长任务时代的旗舰模型,支持真正可用的 1M 上下文,并针对长程 Coding Agent 场景进行了数月强化训练,覆盖大规模实现、自动化研究、性能优化等高价值任务。 相比仅扩展上下文长度的方案,GLM-5.2 在超长上下文下保持更稳定的性能,在 FrontierSWE 上仅落后 Opus 4.8 约 1%,同时超过 GPT-5.5(1%)和 Opus 4.7(11%),实测可承载项目级工程上下文,能把完整工程放进同一条推理链路里,使得长程任务执行更稳定、工程规范遵循更可靠,复杂任务能持续推进,不容易中途跑偏。 GLM-5.2 在前端、后端、长程任务等开发场景下的成功率相比前一代GLM-5.1都有长足提升,复杂系统工程与深度调试更稳。在主流编程基准上,GLM-5.2 保持开源SOTA,与Claude Opus 4.8处于可比区间,一次任务即可完成“从需求到多端可部署产物”的完整开发链路。在全球百万用户参与盲测的前端开发评估系统Code Arena 上,GLM-5.2 取得全球可用模型第一的表现。
    输入模态:
    输出模态:
    输入:
    ¥6.4/M¥8/M
    输出:
    ¥22.4/M¥28/M
    SEO
    翻译
    科技
    角色扮演
    市场
    +7
  • Doubao: Doubao Seedance 2.0 mini
    doubao-seedance-2-0-mini-260615
    Doubao-Seedance-2.0-mini 是豆包大模型团队推出的高性价比视频生成模型,面向更广泛的视频创作与生产需求,该模型在保持竞争力效果的同时,将视频生成能力带入更低门槛、更高频、更规模化的应用场景。依据Artificial Analysis官方网站的测评,该系列模型相较其他视频生成模型来说有较快的视频生成速度,较低的生成成本。 相较 Seedance 2.0,2.0 mini 在价格上进一步下探,生成成本降低约 50%,帮助企业客户以更低成本完成调用。2.0 mini 兼顾成本与可用性,适用于电商内容生产、营销素材批量生成、UGC 内容创作、特效玩法生成等高频、规模化的视频生成场景。
    输入模态:
    输出模态:
    输入:-
    输出:
    ¥14/M
    广告素材生成
    快速创意迭代
    短视频生成
    低成本生成
    轻量模型
    +4
  • 低至6折
    HappyHorse: 1.1-R2V
    happyhorse-1.1-r2v
    HappyHorse-1.1-r2v 是 HappyHorse 系列生成式模型在 1.1 代系中的第二个修正版本,它在继承前代优秀生成能力的基础上,对视觉表征的一致性与语义对齐精度进行了显著优化,为目标场景的创意输出提供了更为稳健且富有表现力的基础。该版本基于大规模多模态对齐预训练,大幅增强了对自然语言描述的细节捕捉能力,能够精准还原复杂提示中的属性、关系与风格约束,幻觉率较 1.0 版本降低约 42%。其核心创新——r2v 跨域生成引擎,支持以现实世界图像作为引导,生成风格化、艺术化且保留原始结构语义的虚拟形象与场景,在角色一致性、背景融合以及光影还原方面达到行业领先水平,特别适用于游戏美术、动画设定及数字人构建等工业化管线。同时,模型内建的动态风格适应模块可在用户指定风格词或上传参考图后,灵活实现高质量的风格迁移与内容生成,使输出结果既忠实于参考又富有创意。 总而言之,该模型进一步提升画面质感、动态表现与跨片段一致性。模型能够更精准地理解输入图像并延续创作意图,在人物皮肤质感、ID跨片段保持、动作流畅度、文字渲染稳定性以及音画同步上带来显著改善,输出更真实自然、细节丰富且一致性更高的高质量视频。
    输入模态:
    输出模态:
    输入:-
    输出:
    低至¥0.54¥0.9
    风格化视频生成
    广告素材生成
    短视频生成
    图生视频
    文生视频
  • 低至6折
    HappyHorse: 1.1-T2V
    happyhorse-1.1-t2v
    HappyHorse-1.1-t2v 是 HappyHorse 系列生成式模型在 1.1 代系中专为文本到视频(Text-to-Video)生成而打造的旗舰版本,它在继承系列优秀的语义理解与视觉表征能力的基础上,着力解决了视频生成领域中的时序一致性、运动自然度和长程依赖等核心难题。该模型基于大规模视频-文本联合预训练,能够从简洁或复杂的自然语言描述出发,直接合成高保真、帧间连贯且具有真实物理运动逻辑的视频内容。其内建的动态时空注意力机制可在维持主体外观恒定的同时,灵活捕捉并还原文本所指定的动作、运镜和场景变换,大幅减少了形变、闪烁与主体漂移等常见生成瑕疵。同时,HappyHorse-1.1-t2v 支持多种视频风格的控制与迁移,用户可通过简单的风格词条或参考帧引导模型生成写实、动漫、电影感或特定画风的连续影像,使其广泛适用于影视预演与概念验证、短视频与创意广告制作、虚拟内容自动生产以及科研教育可视化等领域。通过优化的扩散调度与高效推理架构,该模型在保证生成质量的前提下显著提升了生成效率,为需要高质量动态视觉内容的创作者和工业管线提供了可靠且易用的生成基础。
    输入模态:
    输出模态:
    输入:-
    输出:
    低至¥0.54¥0.9
    物理仿真
    风格化视频生成
    广告素材生成
    短视频生成
    文生视频
  • 低至6折
    HappyHorse: 1.1-I2V
    happyhorse-1.1-i2v
    HappyHorse-1.1-i2v 是 HappyHorse 系列生成式模型在 1.1 代系中专为图像到视频(Image-to-Video)生成而构建的核心版本,它以前沿的多模态条件扩散架构为基础,着力实现从静态图像到动态时序的高保真、高可控转化。模型能够更精准地理解输入图像并延续创作意图,在人物皮肤质感、ID跨片段保持、动作流畅度、文字渲染稳定性以及音画同步上带来显著改善,输出更真实自然、细节丰富且一致性更高的高质量视频。 该模型能够精准继承画面中的主体身份、场景布局、光影氛围和造型细节,并在此基础上生成运动自然、帧间连贯且符合物理逻辑的连续视频内容。其核心创新在于时空一致性保持机制与可控运动注入模块的深度融合,既确保静态图像所承载的视觉内容在动态生成过程中不发生畸变或漂移,又能够依据文本辅助提示或运动参数设定,灵活控制镜头运动、物体动态及环境变化幅度,从而在逼真与想象之间取得出色平衡。HappyHorse-1.1-i2v 广泛适用于将静态视觉资产转化为动态叙事内容的多元场景,包括但不限于影视与广告的动态分镜生成、游戏与动漫中静态原画的动态化呈现、数字人及虚拟场景的驱动展示,以及社交媒体、创意内容生产中图像的二创延伸。通过高效的级联式采样策略与优化的时序去噪调度,该模型为创作者和工业管线提供了将单帧构想快速扩展为高质量动态影像的稳定且高效的解决方案。
    输入模态:
    输出模态:
    输入:-
    输出:
    低至¥0.54¥0.9
    角色一致性
    物理仿真
    广告素材生成
    图生视频
    文生视频
  • Xiaomi: MiMo V2.5
    mimo-v2.5
    MiMo V2.5是小米推出的原生全模态感知模型,支持图像、视频、音频、文本联合理解,实现跨模态精准感知与长程推理,综合感知能力跻身行业前沿。该模型上下文长度可达1M tokens,支持长视频追踪、长文本分析、长时间画面时序推理等长程任务,大幅拓展模型在复杂长流程场景中的适用范围。MiMo V2.5具备原生 Agent 执行能力,可高效完成浏览、理解、推理与操作等复杂任务,日常任务表现比肩 mimo-v2.5-pro的同时实现了更优的token效率,位于性能与效率的 Pareto 前沿。
    输入模态:
    输出模态:
    输入:
    ¥1/M
    输出:
    ¥2/M
    SEO
    翻译
    科技
    角色扮演
    市场
    +5
  • Xiaomi: MiMo V2.5 Pro
    mimo-v2.5-pro
    MiMo-v2.5-pro是由小米MiMo团队自主研发的万亿参数旗舰基座模型,可稳定完成近千轮工具调用的长程任务,代表着小米在人工智能领域的最新技术突破与创新成果。MiMo-v2.5-pro拥有1T级别的参数规模,在自然语言理解、多轮对话、知识推理、代码生成、创意写作等多个领域展现出卓越的性能表现。模型配备1M tokens的超长上下文处理能力,能够精准把握复杂语境,实现深度语义理解与高质量内容输出,满足多样化应用场景需求。在SWE-bench、TAU-bench 等主流 Agent 评测中取得领先,复杂多步任务一次性完成率大幅提升,真实工程场景验证可用。 MiMo-v2.5-pro广泛应用于智能客服、内容创作、教育辅助、办公协作、技术研发等多个领域,无论是日常咨询、专业分析,还是复杂任务处理,MiMo都能高效响应,助力用户提升工作效率与创新能力。
    输入模态:
    输出模态:
    输入:
    ¥3/M
    输出:
    ¥6/M
    SEO
    科技
    角色扮演
    市场
    金融
    +4
  • 低至5折
    MiniMax: MiniMax M3
    minimax-m3
    MiniMax M3是 MiniMax 于2026年6月推出的最新 M 系列语言模型,适用于 Agent 推理、工具调用、代码和长上下文任务。它支持文本、图像和视频输入,输出文本,并拥有100万token的上下文窗口。根据Artificial Analysis测评,该模型处于智能领域领先之列: MiniMax-M3在人工智能分析指数中得分55分,远高于同类模型的平均水平(23分)。MiniMax-M3 具备智能对话、知识问答、内容创作、代码辅助、逻辑分析与多语言支持六大核心能力,可广泛应用于企业服务、教育学习、创意工作、开发研发与日常办公等多种场景。
    输入模态:
    输出模态:
    输入:
    ¥2.1/M¥4.2/M
    输出:
    ¥8.4/M¥16.8/M
    SEO
    翻译
    科技
    角色扮演
    市场
    +5
  • 低至8折
    Qwen: Qwen3.7 Plus
    qwen3.7-plus
    Qwen3.7-Plus是阿里云于2026年6月2日发布的新一代全能型多模态智能体模型,定位为视觉与语言一体化的一体化智能体基座。该模型在Qwen3.7强大文本能力基础上深度融合全域视觉能力,实现“能看、能想、能动手”——可看懂图形界面、操作应用、生成代码并交付结果,将GUI交互与CLI操作无缝打通。在权威视觉榜单Vision Arena中,Qwen3.7-Plus斩获全球前五、中国第一,纯文本能力接近旗舰模型Qwen3.7-Max水平,在11小时自主完成一款英语单词学习APP的完整研发闭环实测中引发了广泛关注,是一款兼具编程能力、多模态推理与工作流自动化能力的高级智能体模型。
    输入模态:
    输出模态:
    输入:
    ¥1.6/M¥2/M
    输出:
    ¥6.4/M¥8/M
    翻译
    科技
    角色扮演
    法律
    金融
    +3
  • 低至5折
    Qwen: Qwen3.7 Max
    qwen3.7-max
    Qwen3.7-Max 是阿里云于 2026 年 5 月发布的旗舰模型,为该系列中规模最大、综合能力最强的版本,当前开放纯文本能力供体验。它拥有 100 万词元上下文窗口,支持文本输入与输出,输出较长内容时仍保持高效。据Artificial Analysis测评,该模型处于智能领域领先之列:智能指数得分 57 分,远高于同类平均(36 分),同价位下性价比合理。作为面向智能体时代的旗舰,其核心优势在于智能体能力的广度与深度,在编程、办公与生产力、长周期自主执行等任务上均表现出色。
    输入模态:
    输出模态:
    输入:
    ¥6/M¥12/M
    输出:
    ¥18/M¥36/M
    科技
    法律
    科研辅助
    编程
  • 低至7.8折
    HappyHorse: 1.0-I2V
    happyhorse-1.0-i2v
    HappyHorse-1.0-I2V是阿里推出的图生视频模型,具备高度还原的动态画面生成能力。该模型以首帧图片为基础,通过文本描述进行引导并有能力精准理解文本语义,生成物理真实、运动流畅、细节丰富的高质量视频。该模型适合用于角色动画、产品展示、创意短片和社媒内容制作等场景,让原本静态的视觉素材更快转化为可传播的动态表达。
    输入模态:
    输出模态:
    输入:-
    输出:
    低至¥0.78¥1
    图生视频
    文生视频
  • 低至7.8折
    HappyHorse: 1.0-T2V
    happyhorse-1.0-t2v
    HappyHorse-1.0-T2V是阿里推出的文生视频模型,具备高度还原的动态画面生成能力,输入文本提示词后模型能够精准理解文本语义,输出物理真实、流畅自然、细节丰富的高质量视频。它适合将创意概念、场景想法和镜头描述快速转化为可视化动态画面,适用于广告创意、短视频制作、分镜预演、品牌内容和社媒传播等场景。相比依赖现成图片素材的方式,T2V 更适合在没有原始视觉资源时,直接把“想法”变成“视频”。
    输入模态:
    输出模态:
    输入:-
    输出:
    低至¥0.78¥1
    文生视频
  • 低至7.8折
    HappyHorse: 1.0-R2V
    happyhorse-1.0-r2v
    HappyHorse-1.0-R2V是阿里云大模型服务平台百炼推出的视频生成与编辑大模型,可支持传入最多9张参考图像或通过文本提示词描述场景,借助更加稳定的主体与场景参考将图像中的主体角色融合生成一段流畅的视频。该模型输出规格包括720P/1080P分辨率、3-15秒时长(24fps MP4格式),能够精准保持创作意图,实现更强表现能力,可赋能专业内容生产。
    输入模态:
    输出模态:
    输入:-
    输出:
    低至¥0.78¥1
    视频模型
  • 低至7.8折
    HappyHorse: 1.0-Video-Edit
    happyhorse-1.0-video-edit
    HappyHorse-1.0-Video-Edit是阿里云大模型服务平台百炼推出的视频生成与编辑大模型,旨在通过文本、图像或参考内容输入,生成高质量、物理真实且运动流畅的视频内容,完成风格变换、局部替换等编辑任务。该模型支持视频编辑,可以用自然语言指令编辑视频,也可参考最多5张图片局部或全局编辑视频元素,能够精准复刻视频动态过程,实现更强表现能力。该模型支持720P/1080P分辨率、3-15秒时长输出,适配广告、电商、短漫剧等场景。
    输入模态:
    输出模态:
    输入:-
    输出:
    低至¥0.78¥1
    视频模型
  • DeepSeek: DeepSeek V4 Flash
    deepseek-v4-flash
    DeepSeek-V4-Flash是深度求索公司于2026年4月24日与V4-Pro一同发布的轻量级MoE模型,总参数2840亿(激活参数130亿),主打极致性价比和高效服务,在 Agent 能力、世界知识和推理性能上均实现国内与开源领域的领先。该模型同样原生支持100万token的超长上下文,采用创新的DSA稀疏注意力机制,将长上下文推理的KV Cache需求压缩至传统方法的7%。在性能方面,V4-Flash在简单任务和推理能力上与Pro版本旗鼓相当,但世界知识储备略逊一筹,在高难度Agent任务上存在差距,而由于模型参数和激活更小, V4-Flash 能够提供更加快捷、经济的 API 服务。定价方面主打经济性,是目前接入顶尖MoE模型架构最具性价比的选择之一。
    输入模态:
    输出模态:
    输入:
    ¥1/M
    输出:
    ¥2/M
    SEO
    翻译
    科技
    角色扮演
    市场
    +6
  • 低至2.5折
    DeepSeek: DeepSeek V4 Pro
    deepseek-v4-pro
    DeepSeek-V4 Pro是深度求索公司于2026年4月24日正式发布并开源的预览版旗舰大模型,拥有1.6万亿总参数(激活参数490亿),在Agent能力、世界知识和推理性能上均达到国内及开源领域的领先水平。该模型通过创新的DSA稀疏注意力机制,原生支持100万token的超长上下文,大幅降低了对计算和显存的需求。在性能表现上,V4-Pro在Agentic Coding评测中达到开源模型最佳水平,使用体验优于Sonnet 4.5,在数学、STEM、竞赛型代码等推理任务中超越所有已公开评测的开源模型,比肩世界顶级闭源模型。
    输入模态:
    输出模态:
    输入:
    ¥3/M¥12/M
    输出:
    ¥6/M¥24/M
    SEO
    翻译
    科技
    角色扮演
    市场
    +6
  • Doubao: Doubao Seedance 2.0
    doubao-seedance-2.0
    Seedance 2.0 是豆包大模型团队推出的新一代专业级多模态创作视频模型。 支持图像、视频、音频等多种模态作为参考输入生成视频,打破单一素材的创作局限,同时具备视频编辑、视频延长等能力,可高精度还原物品细节、材质、音色、视效风格、运镜等,角色特征亦可稳定保持,赋予创作者如同导演般的掌控权。 Seedance 2.0 具备极致拟真的视听稳定性:凭借出色的运动稳定性及画面细节,呈现媲美实拍的影像质感与虚实难辨的视觉冲击。拥有复杂场景的驾驭力,从细腻微表情、激烈肢体对抗,再到富有张力的歌舞,皆能生动还原。同时自带专业运镜、多镜头叙事与文字生成能力,增强叙事张力。原生音画同出,精准匹配视觉生成丰富音效,支持多语种、口音及方言演绎,赋予视频极致的完整度与沉浸感。 Seedance 2.0 深度适配商业广告、影视制作与社交媒体营销三大核心场景。通过工业级标准的生成质量,抽卡成功率大幅提升,降低高品质内容的制作门槛与成本,优化从创意到成片的生产流程,为行业带来显著的效率提升。
    输入模态:
    输出模态:
    输入:-
    输出:
    ¥16/M
    视频模型
  • Doubao: Doubao Seedance 2.0 Fast
    doubao-seedance-2-0-fast
    Seedance 2.0 fast是豆包大模型团队推出的新一代多模态视频创作模型,它继承了Seedance 2.0模型的核心功能和优势,生成速度更快,且可高精度还原物品细节、材质、音色、视效风格、运镜等,角色特征亦可稳定保持,赋予创作者如同导演般的掌控权。 Seedance 2.0 fast支持文字、图片、视频、音频等多模态素材参考生成分辨率480p或720p的视频,同时具备视频编辑与延长能力,使生视频工具进入可精准生成、可复用迭代的工业化新阶段。模型对物理规律的理解持续深化、更贴合真实世界,意图理解能力显著提升,能严格遵循指令细节约束,从而保障专业级叙事的可信度。
    输入模态:
    输出模态:
    输入:-
    输出:
    ¥22/M
    视频模型
  • 低至9.5折
    Doubao: Doubao Seedance 1.5 Pro
    doubao-seedance-1.5-pro
    Seedance 1.5 pro 是豆包大模型团队推出的新一代专业级音画同生视频模型,可支持文字、图片输入,并输出分辨率480p、720p、1080p的视频。它在继承前代多镜头叙事与高清生成能力的基础上,原生支持音视频一体输出,致力于提供画面、人声、音乐、音效的全链路同步创作体验。同时,模型内置首尾帧功能,创作者只需设定视频的起始与结束画面,即可精准锁定视频的风格、构图与角色,并由此驱动模型生成帧间流畅自然的动态影像。在SeedVideoBench-1.5多维度评测中,该模型较市面上主流模型在视频上复杂指令理解精准、画面效果自然真实,在音频多项评测维度上展现出稳定且均衡的整体优势。 音画同生,结合首尾帧控制,Seedance 1.5 pro显著提升了专业视频创作的效率、可控性与艺术表现力。
    输入模态:
    输出模态:
    输入:-
    输出:
    ¥7.6/M¥8/M
    视频模型
  • 低至9.5折
    Doubao: Doubao Seedance 1.0pro fast
    doubao-seedance-1.0-pro-fast
    Seedance 1.0 pro fast 是字节跳动豆包大模型团队于2025年10月推出的视频生成模型,是一款价格触底、效能封顶的全面模型,可通过文字输入的描述生成分辨率480p、720p、1080p的视频,并在视频生成质量、速度、成本之间取得了卓越平衡。它在继承 Seedance 1.0 pro 模型核心优势的基础上,生成速度较Seedance 1.0 pro最高提升约3倍,同时价格极具竞争力,在同等预算下,其视频生成数量可达业内其他模型的3到5倍,帮助创作者充分释放创意潜力,为创作者带来效率与成本双重优化的体验。
    输入模态:
    输出模态:
    输入:-
    输出:
    ¥3.99/M¥4.2/M
    视频模型
  • 低至9.5折
    Doubao: Doubao Seedance 1.0 pro
    doubao-seedance-1.0-pro
    Seedance 1.0 pro是字节跳动豆包大模型团队于2025年5月推出的视频生成基础模型,可通过文字输入的描述生成分辨率480p、720p、1080p的视频。Seedance 1.0 pro作为Seedance 1.0 pro系列的大参数量版本,具备独特的多镜头叙事能力,在各维度表现出色。它在语义理解与指令遵循能力上取得突破,能生成运动流畅、细节丰富、风格多样且具备影视级美感的高清视频。在SeedVideoBench-1.0多维度评测中,该模型较市面上主流模型而言,在T2V任务中,指令遵循、运动表现、画面美感等维度获得较高评分;在I2V任务中,各项指标同样获得较高评分,并能较好地保持原图画面的一致性,取得了良好的评测结果。
    输入模态:
    输出模态:
    输入:-
    输出:
    ¥13.11/M¥13.8/M
    视频模型
  • Doubao: Doubao Seedream 5.0 Lite
    doubao-seedream-5.0-lite
    Doubao-Seedream-5.0-lite 是一款由字节跳动推出的统一架构多模态文生图 + 图像编辑模型,非开源,正式发布于2026 年 2 月 13 日,在字节自研 MagicBench 多维度基准评测中,指令跟随、图文对齐、空间布局、文字渲染四项核心指标相较前代实现大幅领先,凸显其在视觉推理、时效内容生成、精细化图文创作、智能图像编辑方面的突出竞争力,此外,模型在世界知识广度、参考一致性及专业场景生成质量上均有增强,可更好地满足企业级视觉创作需求。该模型核心优势是搭载 CoT 视觉思维链与原生实时联网检索:依靠思维链拆解画面光影、布局逻辑,精准实现复杂构图;依托联网获取实时资讯数据,克服模型知识库滞后问题。它支持 4K 高清出图,文字排版准确率高,可凭 14 张参考图固定人物形象,扩图、重绘等编辑能力出色,出图仅需 2~5 秒,商用调用成本相比上代更低。整体来看,该模型适用于新媒体热点配图、电商宣传物料、PPT 信息可视化、日常插画设计、批量营销海报制作等高频量产类创作场景。
    输入模态:
    输出模态:
    输入:-
    输出:
    低至¥0.22
    生图模型
  • Doubao: Doubao Seedream 4.5
    doubao-seedream-4.5
    Seedream 4.5 是字节跳动最新自主研发的图像生成大模型,整合了文生图、图生图、组图输出等能力,融合常识和推理能力。该模型相较于 4.0 实现了全面提升,尤其在编辑一致性(如主体细节与光影色调的保持)、人像美化和小字生成方面体验升级。同时,模型的多图组合能力显著增强,推理能力与画面美学持续优化,能更精准的控制画面细节,小字、小人脸生成更自然,图片排版、色彩更和谐,更具艺术感地呈现创意,美感提升。
    输入模态:
    输出模态:
    输入:-
    输出:
    低至¥0.25
    生图模型
  • Doubao: Doubao Seedream 4.0
    doubao-seedream-4.0
    Seedream 4.0 是基于领先架构的SOTA级多模态图像创作模型。其打破传统文生图模型的创作边界,原生支持文本、单图和多图输入,用户可自由融合文本与图像,在同一模型下实现基于主体一致性的多图融合创作、图像编辑、组图生成等多样玩法,让图像创作更加自由可控 Seedream 4.0 支持单次输入最多 10 张图像进行复合编辑,并能通过对提示词的深度推理,自动适配最优的图像比例尺寸与生成数量,可一次性连续输出最多 15 张内容关联的图像。此外,模型显著提升了中文生成的准确率与内容多样性,且支持 4K 超高清输出,为专业图像创作提供了从生成到编辑的一站式解决方案。
    输入模态:
    输出模态:
    输入:-
    输出:
    低至¥0.2
    生图模型
  • 低至9折
    Kling: Kling V3 Omni Video
    video-kling-v3-omni
    Kling-V3-Omni 是可灵AI于2026年推出的视频生成模型,支持通过文本、多张图像或视频作为输入,生成最长15秒、最高分辨率4k的高清视频,同时兼备多模态视频编辑、视频延长、数字人、对口型、视频特效、文生音效、视频生音效等功能。该模型具备智能分镜功能,可根据提示词自动规划镜头景别与运动;支持上传参考图或视频片段以保持人物、道具等主体在多镜头中的一致性;同时提供原生音画同步能力,可匹配中、英、日、韩、西等语言及多种中国方言的口型与语音。它适用于短视频制作、广告生成、影视预演等场景,已在2026年3月起向全球用户开放使用。
    输入模态:
    输出模态:
    输入:-
    输出:
    低至¥0.9¥1
    视频模型
  • 低至9折
    Kling: Kling V3 Omni Image
    image-kling-v3-omni
    Kling V3 Omni 是可灵于2026年1月发布的图像创作模型,其图像生成模块支持文生图与多图参考生图,可输出最高4K分辨率的超高清静态图像,并提供“组图”模式以生成具有视觉与叙事连贯性的系列分镜图;同时该模型也支持对多张图进行批量调整与统一优化,大幅减少重复操作。该功能适用于影视概念设计、广告视觉稿及连环插画等场景,确保角色、风格与细节在多张图像间保持高度一致。
    输入模态:
    输出模态:
    输入:-
    输出:
    低至¥0.9¥1
    生图模型
  • 低至9折
    Kling: Kling V3 Video
    video-kling-v3
    Kling V3 Video 是可灵AI(Kling AI)于2026年2月发布的视频生成模型,支持通过文本或图像输入生成最多15秒、最高分辨率4k的高清视频,同时支持多图参考生视频、多模态视频编辑、视频延长、数字人、对口型、视频特效、文生音效、视频生音效等功能。该模型具备首尾帧控制、运镜规划和角色动作一致性能力,可实现精准的镜头表达与物理合理的动态效果。同时集成原生音画同步功能,支持多语种及方言口型匹配,适用于短视频制作、广告创意、影视预演等专业内容生产场景。
    输入模态:
    输出模态:
    输入:-
    输出:
    低至¥0.9¥1
    视频模型
  • 低至9折
    Kling: Kling V3 Image
    image-kling-v3
    Kling V3 Image是可灵于2026年1月发布的图像创作模型,其图像生成能力为关键组成部分:模型支持通过文本或最多10张参考图生成高精度静态帧,用于视频首尾帧控制、分镜预览或独立图像输出,可锁定主体、元素和色调,保证风格一致。图片生成融合风格转绘、人像/角色参考、多图融合及局部重绘,操作灵活;生成图像最高可达2K分辨率,人像细节真实,整体画面细腻丰富,色彩氛围兼具影视感,并在多镜头或多图生成任务中保持角色特征、光影风格与场景细节的一致性,适用于影视概念设计、广告视觉稿及AI辅助创作等图像密集型工作流。
    输入模态:
    输出模态:
    输入:-
    输出:
    低至¥0.9¥1
    生图模型
  • 低至9折
    Kling: Kling V2-5 Turbo
    kling-v2-5-turbo
    Kling-V2.5-Turbo 是快手可灵AI于2025年9月23日发布的视频生成模型,主打高性价比与生成效果的平衡,在图像生成方面,它支持文生图和图生图功能。 新一代模型在文本理解上有所提升,通过优化文本结构与内部处理架构,能够解析包含多个步骤、具有因果关系的指令,生成1080p分辨率的高质量静态画面。 为生成动态效果,新一代模型引入了强化学习等训练方法,并对训练数据分布进行了调整,使模型能够学习并模拟物理动态。 为使视频与参考图像在美学上保持一致性,采用了图像条件注入技术,并基于视频数据进行训练,这项策略能够让模型学习并保持艺术风格。 在全球知名AI基准测试机构Artificial Analysis发布的全球视频生成模型榜单中,可灵2.5 Turbo模型以ELO分数1329(图生视频)和1252(文生视频)同时登顶文生视频与图生视频两大赛道榜首。该模型在美学表现、构图逻辑和细节刻画上较前代有明显提升,适用于广告素材、概念草图、插画及视频关键帧生成等场景。
    输入模态:
    输出模态:
    输入:-
    输出:
    低至¥0.9¥1
    视频模型
  • Qwen: Qwen3.6 Plus
    qwen3.6-plus
    Qwen3.6 Plus是Qwen3.6原生视觉语言系列Plus模型,展现出与当前顶尖前沿模型相媲美的卓越性能,模型效果相较3.5系列显著提升,在Agentic coding、前端编程、Vibe coding等代码能力、多模态万物识别、OCR、物体定位等能力上显著增强。该模型支持文本、图像和视频输入,输出文本,具备100万token的上下文窗口。根据Artificial Analysis测评,Qwen3.6 Plus是智能领域领先模型之一,与同价位其他模型相比性价比突出,其在人工分析智能指数上得分50分,在同类模型中远高于平均水平(36分)。 该模型版本功能等同于快照模型qwen3.6-plus-2026-04-02。
    输入模态:
    输出模态:
    输入:
    ¥2/M
    输出:
    ¥12/M
    科技
    市场
    法律
    Agent
    编程
  • 低至9.5折
    Z.AI: GLM 5.1
    glm-5.1
    GLM-5.1是智谱AI推出的面向长程任务(Long Horizon Task)设计的模型,总参数744B,支持200K超长上下文,最大输出 128K tokens。拥有强大逻辑推理、长文本理解与代码生成能力、兼顾性能与推理效率,能够在单次任务中持续、自主地工作长达 8 小时,完成从规划、执行到迭代优化的完整闭环,交付工程级成果。 在综合能力与 Coding 能力上,GLM-5.1 整体表现对齐 Claude Opus 4.6,并在长程自主执行、复杂工程优化与真实开发场景中展现出更强的持续工作能力,是构建 Autonomous Agent 与长程 Coding Agent 的理想基座。该模型在多任务基准中表现优异,适用于智能交互、企业应用、开发辅助等场景。
    输入模态:
    输出模态:
    输入:
    ¥5.7/M¥6/M
    输出:
    ¥22.8/M¥24/M
    科技
    角色扮演
    市场
    健康
    金融
    +2
  • MoonShot AI: Kimi K2.5
    kimi-k2.5
    Kimi-K2.5是2026年1月27日由月之暗面Kimi发布的新一代开源模型,是月之暗面迄今发布最全能的模型,原生多模态架构设计,同时支持视觉与文本输入、思考与非思考模式、对话与Agent任务。在SWE-Bench Verified和HLE等基准测试中,该模型取得了较高的分数。 在Kimi K2.5的更新中,研发团队推出了智能体集群功能。在执行任务时,该模型能够调度多个具有不同功能的智能体并行工作,处理步骤可达1500个。在大规模搜索场景下,通过并行化可以缩短运行时间。 借助智能体集群,该模型可以协助完成如市场调研、文档翻译、论文综述等任务。 Kimi K2.5的智能体功能也应用于办公场景。该模型具备处理Word、Excel、PPT、PDF等办公文档的能力,能够协助处理数据量较大的表格。用户可以通过自然语言指令操作办公软件,并进行不同格式间的转换。 此外,Kimi K2.5还包含编程产品Kimi Code。Kimi Code可以在终端运行,并能与VSCode、Cursor、Zed等编辑器集成。该产品支持通过输入图片和视频进行编程辅助,降低了技术门槛。
    输入模态:
    输出模态:
    输入:
    ¥4/M
    输出:
    ¥21/M
    科技
    角色扮演
    市场
    学术
    Agent
    +1
  • Z.AI: GLM 5
    glm-5
    GLM-5 是专为复杂系统工程与长程 Agent 任务设计的开源基座模型,旨在为顶尖程序员提供可靠生产力。区别于仅关注代码片段生成的传统模型,GLM-5 突破了“能写代码”到“能构建系统”的界限,具备资深架构师级的长程规划与执行能力。它摒弃了“重前端、轻逻辑”的路径,在后端重构、复杂算法实现及深度调试上展现出卓越的推理与自愈能力,能自主分析日志并迭代修复顽固 Bug 直至系统跑通。 作为开源界首个具备类 Opus 风格及系统工程能力的模型,GLM-5 不仅赋予开发者极致的逻辑密度,更提供了本地部署的自由与高性价比,是大型后端开发与自动化 Agent 构建的理想选择。
    输入模态:
    输出模态:
    输入:
    ¥4/M
    输出:
    ¥18/M
    角色扮演
    Agent
    日常聊天与陪伴
    编程
  • MiniMax: MiniMax M2.7
    minimax-m2.7
    MiniMax M2.7 是一款全方位进化的全能型开源大语言模型,完美融合了硬核的工程生产力与高情商的拟人交互能力。在真实的软件工程场景中,M2.7 展现出卓越的极客素养,不仅能独立承担端到端的完整项目交付,还能高效处理日志排查、代码安全及机器学习等高难度任务。在专业办公领域,它凭借开源最高的 GDPval-AA 得分(1495 ELO),实现了对 Office 三件套的高保真复杂编辑与多轮修改,任务交付能力跃升至行业顶尖水平。作为复杂环境交互的利器,M2.7 在处理长上下文及复杂工具调用时保持着高达 97% 的技能遵循率,其在 MMClaw 的评测表现已直逼的 Sonnet 4.6。更为难得的是,M2.7 打破了传统生产力模型“冷冰冰”的工具属性,具备极佳的身份保持能力与高情商,在赋能企业级自动化的同时,也为互动娱乐场景的创新释放了巨大的想象空间。 总而言之,MiniMax-M2.7 具备广泛的知识储备和强大的语言处理能力。它能够与用户进行流畅自然的对话交流,回答各领域的专业问题,协助完成写作、翻译、总结等文本任务,提供编程方面的技术支持,进行逻辑分析和问题推理。
    输入模态:
    输出模态:
    输入:
    ¥2.1/M
    输出:
    ¥8.4/M
    SEO
    市场
    金融
    学术
    编程
  • MoonShot AI: Kimi K2.7 code
    kimi-k2.7-code
    kimi-k2.7-code是 kimi 迄今最智能的coding模型,在长上下文中更可靠地遵循指令,能以更高的成功率完成编程任务,同时支持文本、图片与视频输入,思考模式,对话与 Agent 任务。
    输入模态:
    输出模态:
    输入:
    ¥6.5/M
    输出:
    ¥27/M
    SEO
    科技
    编程
  • Bytedance:Doubao Seed 2.1 turbo
    doubao-seed-2-1-turbo-260628
    Doubao-Seed-2.1 是面向 Coding 和 Agent 时代打造的新一代大模型,提供 Pro 和 Turbo 两个版本,分别面向高复杂度任务探索和规模化生产场景。相较上一代版本,Seed 2.1 在 Coding 工程交付、Agent 长链路任务执行和多模态理解三大方向上实现全面升级,以更强的自主规划与动态修复能力,胜任真实研发与高价值生产任务。 我是由字节跳动自主研发的生成式人工智能产品豆包,核心搭载字节跳动全栈自研的Seed 2.1 Turbo版本多模态大模型,核心技术全链路自主可控,可全面覆盖知识查询、创意生产、学习辅助、办公提效、多模态交互等多元服务场景,为广大用户提供稳定高效的智能交互服务。 Seed 2.1 Turbo是面向大规模量产场景深度优化的迭代版本,采用升级后的领域感知混合专家架构,依托自研万卡级分布式训练框架完成训练,模型算力利用率较行业平均水平提升40%以上;推理侧通过动态投机解码、专家路由预调度、层级缓存优化等技术,同等生成质量下单Token推理时延较上一版本降低45%,端到端首字响应稳定在150毫秒以内,高并发场景服务可靠性达99.9%。该模型可支撑百万字专业文档、全量代码仓库的深度解析推理;多模态模块支持4K图像像素级识别、2小时4K视频逐帧理解,可精准识别工程图纸、手写公式等细粒度信息,数理推理、代码生成准确率较上一版本提升33%,全链路内嵌事实核验机制,事实类幻觉发生率降低60%以上,可适配云端、端侧多类部署场景。
    输入模态:
    输出模态:
    输入:
    ¥3/M
    输出:
    ¥15/M
    文本模型
  • Bytedance:Doubao Seed 2.1 Pro
    doubao-seed-2.1-pro-260628
    Doubao-Seed-2.1 是面向 Coding 和 Agent 时代打造的新一代大模型,提供 Pro 和 Turbo 两个版本,分别面向高复杂度任务探索和规模化生产场景。相较上一代版本,Seed 2.1 在 Coding 工程交付、Agent 长链路任务执行和多模态理解三大方向上实现全面升级,以更强的自主规划与动态修复能力,胜任真实研发与高价值生产任务。 豆包搭载的字节跳动自研SEED 2.1多模态大模型,是面向大规模量产场景完成全链路优化的技术迭代版本,全栈技术自主可控,所有核心能力均经过亿级真实用户交互场景打磨。该版本采用升级后的领域感知混合专家(MoE)架构,依托自研分布式训练框架,在万卡级混合算力集群上实现58%以上的模型浮点运算利用率,较行业平均训练效率高出近45%;该模型可一次性加载百万字专业书籍、全量代码仓库、十小时以上会议转写内容,跨段落信息抽取、逻辑推导无明显记忆衰减。同时,多模态模块支持4K图像像素级识别、2小时4K视频逐帧解析,可精准识别手写草稿、工程图纸、视频内嵌公式等细粒度内容;全链路内置事实核验闭环,事实类幻觉发生率较上一版本降低62%,量化压缩后的端侧版本可在普通消费终端离线运行,推理时延低至80毫秒,隐私类交互无需上传云端。
    输入模态:
    输出模态:
    输入:
    ¥6/M
    输出:
    ¥30/M
    文本模型
  • Qwen:Qwen3 Embedding 8b
    qwen3-embedding-8b
    Qwen3-Embedding-8B 是通义千问团队全新推出的高性能文本表征模型,基于 80 亿参数的 Qwen3 架构深度定制,专为语义检索、文本分类、聚类分析及检索增强生成(RAG)等核心场景打造;该模型通过先进的对比学习与指令微调技术,实现了对多语言及长上下文文本的精准高维向量映射,在大幅提升语义匹配精度与跨领域泛化能力的同时,完美平衡了推理效率与部署成本,致力于为开发者与企业级用户提供强大、稳定且开箱即用的底层语义理解基础设施。 Qwen3-Embedding-8B提供一整套密集型和专家混合型(MoE)模型,基于广泛的训练,Qwen3在推理、指令遵循、代理能力及多语言支持方面实现突破性的进展。
    输入模态:
    输出模态:
    输入:
    ¥0.35/M
    输出:
    ¥0.35/M
    嵌入模型
  • OpenAI: GPT Image 2(稍不稳定)
    sp-gpt-image-2
    GPT-Image-2 是 OpenAI 于 2026 年 4 月推出的新一代图像生成模型,官方正式名称为 ChatGPT Images 2.0。它被定位为 OpenAI 首个具备原生“思考”推理能力的图像模型,标志着 AI 绘图从单纯的“渲染工具”进化为能进行逻辑规划的“视觉伙伴”。
    输入模态:
    输出模态:
    输入:
    ¥56/M
    输出:
    ¥210/M
    生图模型
  • Google: Nano Banana 2 Pro
    gemini-3-pro-image-preview
    Gemini-3-Pro-Image-Preview(代号 Nano Banana Pro)是 Google 于 2025 年 11 月推出的预览版多模态图像生成与编辑模型,基于强大的 Gemini 3 Pro 推理引擎构建。它不仅能根据文本指令高精度生成含多语言文字、复杂构图和真实物理逻辑的 4K 图像,还支持对话式多轮编辑、知识图谱可视化与搜索增强(Grounding)功能,特别适用于营销素材、技术图表、产品原型等对准确性与细节要求高的专业场景。
    输入模态:
    输出模态:
    输入:
    ¥7/M
    输出:
    ¥420/M
    生图模型
  • Google: Nano Banana 2
    gemini-3.1-flash-image-preview
    Gemini-3.1-Flash-Image-Preview(代号 Nano Banana 2)是 Google 于 2026 年 2 月推出的高效多模态图像生成模型,专为速度与画质平衡而设计。它在保持接近 Pro 级图像质量的同时,显著提升生成速度,支持 4K 超清分辨率、最多 14 张参考图一致性控制、极端宽高比(如 8:1)、精准文字渲染及搜索增强推理,并兼容 OpenAI 与 Gemini 原生接口,适合营销、设计、IP 开发等对效率与专业性要求高的场景 1。
    输入模态:
    输出模态:
    输入:
    ¥3.5/M
    输出:
    ¥420/M
    生图模型
  • 低至9.5折
    MoonShot AI: Kimi K2.6
    kimi-k2.6
    Kimi K2.6 是月之暗面提供的开源模型,是 Kimi 最新最智能的模型。Kimi K2.6 的通用 Agent、代码、视觉理解等综合能力得到全面提升,其中在博士级难度的完整版人类最后的考试(Humanity’s Last Exam)等基准测试中均取得行业领先的成绩;据Artificial Analysis测评,Kimi K2.6在人工分析智能指数上得分54分,远超同类平均(30分)。该模型具备更强更稳的长程代码编写能力,指令遵循和自我纠错能力显著提升,同时支持文本、图片与视频输入,思考与非思考模式,对话与 Agent 任务。
    输入模态:
    输出模态:
    输入:
    ¥6.175/M¥6.5/M
    输出:
    ¥25.65/M¥27/M
    Agent
    深度思考
    编程
  • 低至9折
    Vidu: Image ViduQ2
    image-vidu-q2
    Image-Vidu-Q2 是生数科技 Vidu Q2 系列中的核心图像生成模块,集文生图、参考生图与高精度图像编辑于一体,主打“超强一致性”与4K超清输出。它支持通过单张或多张参考图精准控制人物形象、构图、动作及风格,并能对图像局部进行智能增删改——如换装、换背景、擦除物体或重绘材质——仅需一句自然语言指令即可完成。该模型在国际权威测评中图像编辑能力跻身全球前三,超越OpenAI GPT-5,媲美Google Nano Banana2。Image-Vidu-Q2 还无缝衔接视频生成流程,用户可将生成的图像一键保存为主体,直接用于后续图生视频创作,构建从静态图像到动态影像的一站式多参工作流,广泛应用于电商、文创、短剧角色设定等需要高保真视觉一致性的场景。
    输入模态:
    输出模态:
    输入:-
    输出:
    低至¥0.9¥1
    生图模型
  • 低至9折
    Vidu: Video ViduQ2
    video-vidu-q2
    Video-Vidu-Q2 是生数科技推出的第二代AI视频生成模型 Vidu Q2 的标准版本,专注于高质量、高可控性的动态影像生成。它支持图生视频与参考生视频两种核心模式,可生成2至8秒、最高1080P分辨率的高清视频,具备电影级运镜、多主体一致性控制(最多7个主体)以及自然表情与流畅动作生成能力。Vidu Q2 引入了“参考驱动”理念,用户可通过上传参考图片或视频,精准控制人物外观、场景氛围、动作节奏等关键元素,显著提升生成内容的稳定性和可用性。该模型在VBench等权威评测中表现优异,适用于短剧分镜、广告预演、动漫制作等对画面逻辑与角色一致性要求较高的专业场景,是连接创意构思与视觉落地的重要生产力工具。
    输入模态:
    输出模态:
    输入:-
    输出:
    低至¥0.9¥1
    视频模型
  • 低至9折
    Vidu: ViduQ2 Turbo
    vidu-q2-turbo
    Vidu Q2 Turbo 是生数科技在 Vidu Q2 基础上推出的加速优化版本,聚焦于更快的生成速度与更高的创作效率,同时保留了Q2核心的“细微表情生成”能力和电影级运镜控制。它支持2至8秒的图生视频与首尾帧视频生成,提供“电影大片”和“闪电出片”双模式,并强化了多主体一致性(最多7个主体)与4K超清渲染能力。相比标准版Q2,Turbo版本通过模型压缩与工程优化显著缩短推理时间,适合对生成速度敏感的广告、电商、短剧等高频创作场景,在保证画面细节与情感表现力的同时实现“秒级出片”。
    输入模态:
    输出模态:
    输入:-
    输出:
    低至¥0.9¥1
    视频模型
  • 低至9折
    Vidu: ViduQ3 Pro Video
    video-viduq3-pro
    Vidu Q3 Pro 是生数科技推出的旗舰级AI视频生成模型,支持一键生成长达16秒、1080P高清、声画同步的视频内容,是全球首个在该时长内实现高质量音视频一体生成的大模型。它不仅能精准匹配角色口型与多语种对白(包括中文、英文、日文),还能自动完成远景、中景、特写等多镜头切换,并支持画面内文字渲染,解决了排版杂乱、文字模糊、与画面不协调的问题,减少了大量后期工作量。基于自研U-ViT架构,Vidu Q3 Pro 在国际权威评测中位列全球第二、中国第一,专为短剧、广告、影视预演等专业创作场景打造,真正实现从“生成画面”到“讲好故事”的跨越。
    输入模态:
    输出模态:
    输入:-
    输出:
    低至¥0.9¥1
    视频模型
  • Qwen: Qwen3.5 Omni Flash
    qwen3.5-omni-flash
    Qwen3.5-Omni是Qwen推出的全模态大模型,支持文本、图像、语音和视频输入,输出文本和语音,具备256k token上下文窗口。作为 Qwen3-Omni 的全面进化版本, 支持超过 10 小时的音频理解及超过 400 秒的 720P(1 FPS)音视频理解与对话,并进一步拓展语言范围,支持60+种语言音频输入,30+语言语音输出,并且具备强大的结构化音视频理解能力,广泛应用于文本创作、语音助手、多媒体分析等场景,提供自然流畅的多模态理解与交互体验。 Qwen 3.5 Omni Flash在智能领域处于领先地位,在Artificial Analysis智能指数上得分为19分,在同类模型中表现远超平均水平(11分)。
    输入模态:
    输出模态:
    输入:
    ¥3.3/M
    输出:
    ¥20/M
    文档分析
    内容创作
  • Z.AI: GLM 5 Turbo
    glm-5-turbo
    GLM-5-Turbo 是面向 OpenClaw 龙虾场景深度优化的基座模型。 其从训练阶段就针对龙虾任务的核心需求进行专项优化,增强如工具调用、指令遵循、定时与持续性任务、长链路执行等核心能力,使其在复杂、动态、长链路的任务中也真正具备可执行性。
    输入模态:
    输出模态:
    输入:
    ¥5/M
    输出:
    ¥22/M
    文本模型
  • StepFun: Step 3.5 Flash
    step-3.5-flash
    Step 3.5 Flash 是阶跃星辰发布的旗舰语言推理模型,具备顶尖推理能力与快速可靠的执行能力,能够完成复杂任务的分解与计划,可快速可靠地调用工具执行任务,胜任逻辑推理、数学、软件工程、深度研究等各种复杂任务。该模型基于 196B 总参数 / 11B 激活参数的稀疏 MoE 架构,总参数 196B,每个 token 仅激活 11B 参数。模型支持 256K 上下文窗口,通过 3 路多 token 预测(MTP-3)实现 100-300 tok/s 的生成吞吐量。其在编程和 Agent 任务上表现优异,SWE-bench Verified 达到 74.4%,Terminal-Bench 2.0 达到 51.0%。
    输入模态:
    输出模态:
    输入:
    ¥0.7/M
    输出:
    ¥2.1/M
    Agent
    编程
  • ByteDance: Doubao Seed 2.0 Code
    doubao-seed-2.0-code-preview-260215
    Doubao-Seed-2.0-Code 面向企业级编程需求优化,在 Seed 2.0 优秀的 Agent、VLM 能力基础上,特别增强了代码能力,不仅前端能力表现出众,也对企业常见的多语言编码需求做了特别优化,适合接入各种 AI 编程工具使用。 该模型有一下几点新特性: 基于强大基座模型:基于 Seed 2.0 的基座模型,Doubao-Seed-2.0-Code 有优秀的 Agentic 能力,支持 Skills 调用和自定义工具使用;VLM 能力优秀,支持基于图片的 Browser Use 等工具使用; 面向编程任务优化:特别优化了使用各种编程语言和编程工具的能力,在多轮长程任务下表现出色; 复杂指令遵循:能理解长而复杂的编程指令,稳定交付符合预期的产物; 支持隐式缓存:无需额外配置,自动开启缓存命中,适合Agentic等复杂上下文场景。请求内容的公共前缀会被自动缓存,但不保证缓存命中。通常需要累计至少 1024 个 tokens 才会触发缓存命中。
    输入模态:
    输出模态:
    输入:
    ¥3.2/M
    输出:
    ¥16/M
    文本模型
  • ByteDance: Doubao Seed 2.0 Mini
    doubao-seed-2.0-mini-260215
    Doubao-Seed-2.0-mini 主要面向低时延、高并发与成本敏感场景,提供极致的模型推理速度。模型效果与Doubao-Seed-1.6相当,支持256k上下文、四档思考长度和多模态理解,适合成本和速度优先的轻量级任务。 该模型拥有高频简单场景的极致性价比,面向高并发、短链路、标准化任务,强调“推理更快、部署更灵活”。非思考模式的综合表现达思考模式效果85%,但tokens消耗量只有十分之一,在简单高频场景中实现快速响应与极致性价比。 该模型在内容识别和知识推理上相较上一代flash小尺寸模型大幅提升,超越Doubao-Seed-1.6-pro综合表现,代码和agent表现也有显著提高,满足企业常见图文输入的理解与结构化输出需求。 该模型ToB任务能力更强更稳定,在图像审核、图像分类、视频巡检等tob常见领域的识别能力显著提升,异常模式相比 Doubao-Seed1.6-flash下降40%,冗余问题有明显改善。 该模型视觉质量与预算策略更可控,提供分档的图像质量与资源预算策略(low, high, xhigh),默认高质量模式提升可预期性,并支持更高质量档位以应对高密度文本、复杂图表与细节丰富场景。
    输入模态:
    输出模态:
    输入:
    ¥0.2/M
    输出:
    ¥2/M
    文本模型
  • ByteDance: Doubao Seed 2.0 Lite
    doubao-seed-2.0-lite-260215
    Doubao-Seed-2.0全系列是面向企业规模化部署的轻量级全模态模型,支持文本、图片、语音、视频四模态跨模态联合理解。集成音画协同分析、长视频时序检索、全维度音频解析、代码开发、智能Agent与GUI闭环操作能力,适配大批量全模态推理业务场景。 其中,Doubao-Seed-2.0-lite 支持视频、图像、音频、文本原生统一理解,是豆包大模型家族首款全模态理解模型,同时升级Agent、Coding与GUI能力。在同等算力成本下,是面向高频企业场景、兼顾性能与成本的均衡型模型,是企业大规模、批量化部署全模态推理任务的更优性价比选择。 该模型综合能力超越上一代Doubao-Seed-1.8。胜任非结构化信息处理、内容创作、搜索推荐、数据分析等生产型工作,支持长上下文、多源信息融合、多步指令执行与高保真结构化输出。在保障稳定效果的同时显著优化成本。
    输入模态:
    输出模态:
    输入:
    ¥0.6/M
    输出:
    ¥3.6/M
    文本模型
  • ByteDance: Doubao Seed 2.0 Pro
    doubao-seed-2.0-pro-260215
    Doubao-Seed-2.0-pro是旗舰级全能通用模型,面向 Agent 时代的复杂推理与长链路任务执行场景。该模型强调多模态理解、长上下文推理、结构化生成与工具增强执行,复杂指令与多约束执行能力突出,可稳定应对多步复杂规划、复杂图文推理、视频内容理解与高难度分析等场景。 该模型拥有以下新特性: 企业级 Agent 编排与交付能力升级:面向知识密集型流程,复杂检索、工具调用与多步任务可自动编排并稳定交付;代码能力进一步“智能体化”,代码向智能体版本进一步优化,覆盖工程化拆解与端到端应用开发。 更可靠的复杂指令执行:提升了指令遵循表现,并强化了对多约束、多步骤、长链路任务的理解与执行能力,已具备支撑高价值任务的能力基础。 多模态理解与推理升级:视觉感知、视觉推理与空间理解全面增强,对复杂版式文档、图表与图形等非结构化输入的解析更稳;多模态长上下文融合能力更强,支持更高保真结构化输出。 长视频与实时视频流能力升级:支持小时级长视频的连贯理解与高精度推理,并具备流式实时分析与主动反馈能力,实现从被动问答到主动指导的交互升级。 ToB 高频任务与垂直场景适配:在信息抽取、参考问答、文本分析等高频企业工作流上整体能力提升,并通过长尾领域知识与多源信息融合增强垂直领域可用性,覆盖更复杂的数据处理、分析与客服类 Agent 任务。 视觉质量与预算策略可控更可控:提供分档的图像质量与资源预算策略(low, high, xhigh),默认高质量模式提升可预期性,并支持更高质量档位以应对高密度文本、复杂图表与细节丰富场景。
    输入模态:
    输出模态:
    输入:
    ¥3.2/M
    输出:
    ¥16/M
    文本模型
  • Google: Gemini 3 Pro Preview
    gemini-3-pro-preview
    Gemini 3 Pro Preview 是 Google 推出的革命性多模态大语言模型,代表了人工智能技术的最新突破。作为 Gemini 系列的最新成员,该模型在推理能力、多模态理解和创新应用方面达到了前所未有的高度。 🔥 核心优势 • 超强推理能力:具备接近人类水平的逻辑推理和问题解决能力,能够处理复杂的数学、科学和哲学问题 • 原生多模态:无缝融合文本、图像、音频和视频理解,支持跨模态的深度分析和生成 • 智能体工作流:内置智能体框架,能够自主规划、执行复杂任务链,实现真正的 AI 助手体验 • 自主编程:具备强大的代码理解和生成能力,支持多种编程语言,能够独立完成软件开发任务 💡 技术特色 • 支持超长上下文(1M+ tokens),能够处理大型文档和复杂项目 • 实时流式输出,提供流畅的交互体验 • 先进的安全机制,确保输出内容的可靠性和安全性 • 高效的推理架构,在保证质量的同时提供快速响应 🚀 应用场景 • 智能客服与对话系统 • 内容创作与营销文案 • 代码开发与技术支持 • 数据分析与报告生成 • 教育培训与知识问答 • 多媒体内容理解与处理 Gemini 3 Pro Preview 不仅是一个语言模型,更是一个能够理解世界、创造价值的智能伙伴,致力于将每一个创意想法转化为现实。
    输入模态:
    输出模态:
    输入:
    ¥14/M
    输出:
    ¥84/M
    文本模型
  • Qwen: Qwen3.5 35B A3B
    qwen3.5-35b-a3b
    通义千问 3.5(Qwen3.5)是阿里巴巴集团通义实验室倾力打造的代际升级旗舰模型,旨在为用户与企业提供专业、高效且可信赖的智能核心引擎。该模型聚焦核心应用场景,在逻辑推理准确性、全栈代码开发支持、超长上下文精准理解及全球百余种语言交互等关键维度实现了显著突破:无论是复杂科学难题的拆解、软件工程的自动化协作,还是海量文档的结构化分析,均能提供卓越的性能支撑,能够灵活适应医疗、金融等垂直行业需求,同时确保服务的可靠性与伦理安全性。 Qwen3.5系列35B-A3B原生视觉语言模型基于混合架构设计,融合了线性注意力机制与稀疏混合专家模型,实现了更高的推理效率。该模型的综合表现接近于Qwen3.5-27B。
    输入模态:
    输出模态:
    输入:
    ¥0.4/M
    输出:
    ¥3.2/M
    科研辅助
  • Qwen: Qwen3.5 Flash
    qwen3.5-flash
    Qwen3.5原生视觉语言系列Flash模型,基于混合架构设计,融合了线性注意力机制与稀疏混合专家模型,实现了更高的推理效率。模型效果在纯文本与多模态方面相较3系列均实现飞跃式进步;响应速度快,兼具推理速度和性能。
    输入模态:
    输出模态:
    输入:
    ¥0.2/M
    输出:
    ¥2/M
    翻译
    法律
  • Qwen: Qwen3.5 397B A17B
    qwen3.5-397b-a17b
    Qwen3.5系列397B-A17B原生视觉语言模型,基于混合架构设计,融合了线性注意力机制与稀疏混合专家模型,实现了更高的推理效率。在语言理解、逻辑推理、代码生成、智能体任务、图像理解、视频理解、图形用户界面(GUI)等多种任务中,均展现出与当前顶尖前沿模型相媲美的卓越性能。具备强大的代码生成与智能体能力,对于各类智能体场景具有良好的泛化性。
    输入模态:
    输出模态:
    输入:
    ¥1.2/M
    输出:
    ¥7.2/M
    翻译
    健康
  • Qwen: Qwen3.5 Plus
    qwen3.5-plus
    Qwen3.5原生视觉语言系列Plus模型,基于混合架构设计,融合了线性注意力机制与稀疏混合专家模型,实现了更高的推理效率。在多项任务评测中,3.5系列均展现出与当前顶尖前沿模型相媲美的卓越性能,模型效果在纯文本与多模态方面相较3系列均实现飞跃式进步。
    输入模态:
    输出模态:
    输入:
    ¥0.8/M
    输出:
    ¥4.8/M
    文本模型
  • MiniMax: MiniMax M2.5 Highspeed
    minimax-m2.5-highspeed
    MiniMax-M2.5 是面向 Agent 时代打造的新一代大模型,经过数十万个真实复杂环境中的大规模强化学习训练,在编程、搜索与工具调用、办公生产力等核心场景实现全面升级,并在多项权威基准上达到或刷新行业领先水平。模型在 SWE-Bench Verified、Multi-SWE-Bench、BrowseComp 等评测中表现突出,展现出更强的复杂任务拆解、长期规划与稳定执行能力。 在能力层面,M2.5 显著强化了端到端解决复杂任务的综合表现,尤其在编程场景中具备更接近“架构师式”的思考与构建能力,能够覆盖从系统设计、环境搭建、功能开发到代码审查与测试优化的全流程。与此同时,模型在搜索与工具调用方面具备更成熟的决策能力,能够以更少轮次和更高 token 效率完成复杂任务;在办公场景中,也能围绕 Word、PPT、Excel 等高阶需求生成更具专业性和可交付性的成果。 在效率与成本方面,M2.5 延续了 MiniMax 对高性能、低成本 Agent 模型的持续探索。模型支持高吞吐推理,并通过优化任务拆解能力、token 使用效率和工具协同能力,显著缩短复杂任务完成时间。结合极具竞争力的价格体系,M2.5 进一步降低了大规模部署智能体的门槛,为构建和运营高频、长时、复杂的 Agent 应用提供了更现实的基础。 整体来看,MiniMax-M2.5 不仅代表了模型能力的持续跃升,也展示了强化学习在真实 Agent 场景中的巨大潜力,将为智能体在研发、办公与行业应用中的深入落地提供更强支撑。 本模型是M2.5极速版,支持 100 TPS 极速推理,有更高效率。
    输入模态:
    输出模态:
    输入:
    ¥4.2/M
    输出:
    ¥16.8/M
    Agent
    编程
  • Baidu: Ernie 4.5 Turbo 128K
    ernie-4.5-turbo-128k
    ERNIE 4.5 系列模型的优越性能,主要得益于其在预训练、模型架构与训练基建、以及后训练优化等多个层面的系统性创新。 首先,在预训练阶段,ERNIE 4.5 采用多模态混合专家模型,通过文本与视觉模态的联合学习,显著提升了模型对跨模态细粒度信息的感知、对齐与推理能力。其创新性的多模态异构混合专家结构,结合多维旋转位置编码,并在损失函数设计中强化专家间正交性、优化不同模态词元的训练平衡,有效实现了模态间的相互促进。其次,在模型架构与训练基础设施方面,ERNIE 4.5 提出了高效且具备良好扩展性的技术方案,包括异构混合并行、多级负载平衡、内存高效流水线调度及 FP8 混合精度训练等关键技术,显著提升了大规模多模态模型的训练效率;在推理阶段,又通过多专家协同并行量化方法实现高性能、无损量化部署。最后,针对不同应用场景,ERNIE 4.5 还开展了面向特定模态的后训练,结合 SFT、DPO、UPO 等多阶段优化方法,进一步增强了文本与视觉模型在实际任务中的理解、生成与推理表现。 其中,文心4.5 Turbo在去幻觉、逻辑推理和代码能力等方面也有着明显增强。对比文心4.5,速度更快、价格更低。
    输入模态:
    输出模态:
    输入:
    ¥0.8/M
    输出:
    ¥3.2/M
    文本模型
  • DeepSeek: DeepSeek V3
    deepseek-v3
    DeepSeek-V3 为杭州深度求索人工智能基础技术研究有限公司自研的 MoE 模型,相比 V2.5 模型生成速度实现 3 倍提升,为用户带来更加迅速流畅的使用体验。 该模型具备128K超长上下文处理能力,能够精准理解和分析长篇复杂文本内容,在阅读理解和知识归纳任务中表现出色。该版本特别强化了多文档处理功能,支持直接解析PDF、Word、Excel、PPT等常见文件格式,为用户提供高效的信息提取和知识整合服务。 在专业能力方面,DeepSeek-V3经过特定领域的强化训练,在编程开发、数学计算、学术研究、商业分析等场景展现出卓越表现。其代码生成与解释能力达到业界领先水平,能够辅助开发者完成从简单脚本到复杂系统的开发工作。同时,模型的多语言处理能力也显著提升,支持中英日韩等多种语言的高质量互译和交流。 DeepSeek-V3创新性地引入了用户可控的联网搜索功能,通过手动激活可以获取最新资讯,有效解决了传统大模型知识时效性受限的问题。模型严格遵循数据安全和隐私保护原则,所有交互都经过严格的内容安全过滤,确保服务的安全可靠。
    输入模态:
    输出模态:
    输入:
    ¥2/M
    输出:
    ¥8/M
    SEO
    翻译
    市场
    健康
    金融
  • MiniMax: MiniMax M2.5
    minimax-m2.5
    M2.5 已经在 MiniMax Agent 中全面上线,带来最佳 Agentic 体验。 我们将处理信息的核心能力,提炼为标准的 Office Skills,深度集成于 Agent 中。全能(MAX)模式下,处理 Word 排版、PPT 编辑、Excel 测算等任务时,MiniMax Agent 将自动根据文件类型加载对应的 Office Skills,提升任务输出质量。此外,用户还可以将 Office Skills 与特定领域的行业经验相结合,创建面向特定任务场景的、可复用的专家(Expert)。 以行业研究为例,将成熟的研究框架 SOP 与 Word Skills 融合后,Agent 能够严格按照既定框架,自动抓取数据、组织分析逻辑,并输出格式规范的研报文档,而非仅仅生成一段粗略的文字。在金融建模场景中,将机构专属的建模规范与 Excel Skills 结合,Agent 则可以遵循特定的风控逻辑与测算标准,自动生成并校验复杂的财务模型,而不只是输出一张简单的表格。 截至目前,用户已经在 MiniMax Agent 上构建了 1 万多个专家,且仍在快速增长。MiniMax 也针对办公、金融、编程等高频场景,在 MiniMax Agent 上构建了多组深度优化、开箱即用的专家套组。 MiniMax 内部已率先受益于 M2.5 的模型能力。在 MiniMax 真实业务场景中,整体任务的 30% 由 M2.5 自主完成,覆盖研发、产品、销售、HR、财务等职能,且渗透率仍在持续上升。其中,在编程场景表现尤为突出,M2.5 生成的代码已占新提交代码的 80%。
    输入模态:
    输出模态:
    输入:
    ¥2.1/M
    输出:
    ¥8.4/M
    编程
  • ByteDance: Doubao Seed 1.8
    doubao-seed-1-8-251228
    Doubao-Seed-1.8是字节跳动推出的新一代高效轻量级大语言模型,作为Doubao-Seed系列的迭代升级产品,它延续了“高性能、易部署、低成本”的核心定位,通过优化模型架构设计、迭代精细化训练策略与精炼多领域高质量数据,实现了核心能力与部署效率的双重提升。 Doubao-Seed-1.8 面向多模态 Agent 场景定向优化。Agent 能力上,Tool Use、复杂指令遵循等能力均大幅增强。多模态理解方面,视觉基础能力显著提升,可低帧率理解超长视频,视频运动理解、复杂空间理解及文档结构化解析能力也有所优化,还原生支持智能上下文管理,用户可配置上下文策略。 该模型输出内容兼具准确性、多样性与实用性,已广泛应用于智能客服、智能家居助手、移动端AI工具、企业办公辅助等场景。
    输入模态:
    输出模态:
    输入:
    ¥0.8/M
    输出:
    ¥2/M
    Agent
  • Z.AI: GLM 4.5
    glm-4.5
    模型介绍 GLM-4.5 是专为智能体应用打造的混合专家 (MoE) 语言模型,拥有320 亿个激活参数和3550 亿个总参数。GLM-4.5具备混合推理能力,提供两种模式:用于复杂推理和工具使用的思维模式,以及用于立即响应的非思维模式。 主要特点 代理任务强化:具备128k上下文长度和原生函数调用能力 全栈编码能力:涵盖前后端开发、工具开发、数据分析、测试和算法实现 支持复杂推理:可以解决包括数学、科学、逻辑等复杂的推理问题 更高参数效率:相对于同等规模模型表现出更优异的性能 模型变体 GLM-4.5-Air:采用更紧凑的设计,在保持卓越效率的同时,也展现出极具竞争力的成绩。
    输入模态:
    输出模态:
    输入:
    ¥2/M
    输出:
    ¥8/M
    编程
  • Qwen: Qwen3 Coder
    qwen3-coder
    模型亮点 今天,我们隆重推出Qwen3-Coder,这是我们迄今为止最具代理性的代码模型。Qwen3 -Coder有多种尺寸可供选择,但我们很高兴首先推出其最强大的版本:Qwen3-Coder-480B-A35B-Instruct。它具有以下主要增强功能: 在Agentic Coding、Agentic Browser-Use和其他基础编码任务的开放模型中表现出色,取得了与 Claude Sonnet 相当的成果。 长上下文功能原生支持256K 个令牌,可使用 Yarn 扩展至1M 个令牌,并针对存储库规模的理解进行了优化。 Agentic Coding支持大多数平台,例如Qwen Code、CLINE,具有专门设计的函数调用格式。 <img src= https://qianwen-res.oss-cn-beijing.aliyuncs.com/Qwen3-Coder/qwen3-coder-main.jpg width=600/> 模型概述 Qwen3-Coder-480B-A35B-Instruct具有以下特点: 类型:因果语言模型 训练阶段:训练前和训练后 参数数量:共480B,已激活35B 层数:62 注意力头数量(GQA):Q 为 96 个,KV 为 8 个 专家人数:160 已激活专家数量:8 上下文长度:本机为 262,144。
    输入模态:
    输出模态:
    输入:
    ¥15/M
    输出:
    ¥60/M
    文本模型
  • Qwen: Qwen3 30B A3B Instruct 2507
    qwen3-30b-a3b-instuct-2507
    模型介绍 Qwen3-30b-a3b-instuct-2507是基于Qwen3的非思考模式开源模型,相较上一版本(通义千问3-30B-A3B)中英文和多语言整体通用能力有大幅提升。主观开放类任务专项优化,显著更加符合用户偏好,能够提供更有帮助性的回复。 主要特点 一般能力显著提高,指令跟随、逻辑推理、文本理解、数学、科学、编码和工具使用等领域的能力均有提升。 跨多种语言的长尾知识覆盖率大幅提升。 在主观和开放式任务中都能更好地与用户偏好保持一致,用户能够获取更多有用回答和更高质量的文本生成结果。 模型变体 Qwen3-235b-a22b-instruct-2507/Qwen3-235b-a22b-thinking-2507/Qwen3-30b-a3b-thinking-2507:Qwen3-2507版本中将思考模式和非思考模式拆分,提供不同的模型变体; Qwen3-235B-A22B:Qwen系列中最新一代大型语言模型,提供全面的密集模型和混合专家 (MoE) 模型。支持思考/非思考模式,推理能力大幅增强,精通代理能力,具有强大的多语言指令跟踪和翻译能力。
    输入模态:
    输出模态:
    输入:
    ¥0.75/M
    输出:
    ¥3/M
    文本模型
  • Kimi: Kimi K2 0905 jcloud
    kimi-K2-0905-jcloud
    模型介绍 Kimi K2 模型的最新版本 0905,进一步提升其在真实编程任务中的表现: Agentic Coding 能力提升:在公开基准测试和真实的编程任务中均展现出更好的性能 前端编程体验升级:提升了前端代码的美观度和实用性 扩展上下文长度:从 128K 升级到 256K,为复杂长线任务提供更好的支持 提供高速版 API:支持高达 60-100 Token/s 的输出速度 在侧重考察真实软件工程任务的 SWE-bench Verified 等基准测试中,新版 Kimi K2 模型的表现如下: <img src= https://maas.s3.cn-north-1.jdcloud-oss.com/Kimi-K2-0905/0905-2%20%281%29.webp width=600/> 已上架 kimi-k2-0905-preview 模型 API: 上下文升级到 256K Token Enforcer 保证 toolcall 100% 格式正确 完全兼容 Anthropic API、并支持 WebSearch Tool,提供更好的 K2 + Claude Code 使用体验 支持全自动 Context Caching,有助于节省 Input Token 定价与之前的 0711 版相同 速度达 60-100 Token/s 的高速版 API(kimi-k2-turbo-preview)已同步升级新模型 Kimi K2 模型最初发布于 7 月 11 日,它是一款混合专家架构(MoE)的开源基础模型,总参数 10000 亿,激活参数 320 亿。目前,AI 编程工具 Cursor、Windsurf、Trae、Cline、RooCode、Kilo Code 等已内置或接入了 Kimi K2 模型。国内外云服务厂商均部署了 Kimi K2 模型,为开发者提供更多选择。
    输入模态:
    输出模态:
    输入:
    ¥4/M
    输出:
    ¥16/M
    文本模型
  • DeepSeek: DeepSeek R1 Distill Qwen 32B
    deepseek-r1-distill-qwen-32b
    DeepSeek-R1-Distill-Qwen-32B是一个基于Qwen2.5-32B的蒸馏大型语言模型,使用了 DeepSeek R1 的输出。
    输入模态:
    输出模态:
    输入:
    ¥1.3/M
    输出:
    ¥1.3/M
    深度思考
  • DeepSeek: DeepSeek R1 Distill Qwen 14B
    deepseek-r1-distill-qwen-14b
    DeepSeek-R1-Distill-Qwen-14B是一个基于Qwen2.5-14B的蒸馏大型语言模型,使用了 DeepSeek R1 的输出。
    输入模态:
    输出模态:
    输入:
    ¥1/M
    输出:
    ¥3/M
    深度思考
  • DeepSeek: DeepSeek R1 Distill Qwen 7B
    deepseek-r1-distill-qwen-7b
    DeepSeek-R1-Distill-Qwen-7B是一个基于Qwen2.5-Math-7B的蒸馏大型语言模型,使用了 DeepSeek R1 的输出。
    输入模态:
    输出模态:
    输入:
    ¥0.5/M
    输出:
    ¥1/M
    深度思考
  • DeepSeek: DeepSeek R1 0528
    deepseek-r1-0528
    0528为R1模型的小版本升级,相较于旧版 R1,新版在复杂推理任务中的表现有了显著提升。在数学、编程与通用逻辑等多个基准测评中取得了优异成绩。
    输入模态:
    输出模态:
    输入:
    ¥4/M
    输出:
    ¥16/M
    深度思考
    编程
  • DeepSeek: DeepSeek V3.1
    deepseek-v3.1
    DeepSeek-V3.1为混合推理架构模型,同时支持思考模式与非思考模式,具备更高的推理效率和更强的Agent能力。
    输入模态:
    输出模态:
    输入:
    ¥4/M
    输出:
    ¥12/M
    深度思考
  • Qwen: Qwen3 8B
    qwen3-8b
    实现思考模式和非思考模式的有效融合,可在对话中切换模式。推理能力达到同规模业界SOTA水平、通用能力显著超过Qwen2.5-7B。
    输入模态:
    输出模态:
    输入:
    ¥0.3/M
    输出:
    ¥0.6/M
    日常聊天与陪伴
  • Qwen: Qwen3 14B
    qwen3-14b
    实现思考模式和非思考模式的有效融合,可在对话中切换模式。推理能力达到同规模业界SOTA水平、通用能力显著超过Qwen2.5-14B。
    输入模态:
    输出模态:
    输入:
    ¥0.8/M
    输出:
    ¥1.6/M
    文本模型
  • Qwen: Qwen3 30B A3B
    qwen3-30b-a3b
    基于Qwen3的非思考模式开源模型,相较上一版本(通义千问3-30B-A3B)中英文和多语言整体通用能力有大幅提升。主观开放类任务专项优化,显著更加符合用户偏好,能够提供更有帮助性的回复。
    输入模态:
    输出模态:
    输入:
    ¥0.75/M
    输出:
    ¥3/M
    智能问答
    多语言翻译
  • Qwen: Qwen3 32B
    qwen3-32b
    实现思考模式和非思考模式的有效融合,可在对话中切换模式。推理能力显著超过QwQ、通用能力显著超过Qwen2.5-32B-Instruct,达到同规模业界SOTA水平。
    输入模态:
    输出模态:
    输入:
    ¥1/M
    输出:
    ¥4/M
    文本模型
  • Qwen: Qwen3 235B A22B
    qwen3-235b-a22b
    基于Qwen3的思考模式开源模型,相较上一版本(通义千问3-235B-A22B)逻辑能力、通用能力、知识增强及创作能力均有大幅提升,适用于高难度强推理场景。
    输入模态:
    输出模态:
    输入:
    ¥2/M
    输出:
    ¥8/M
    资料解读
  • Qwen: Qwen3 A3B Instruct 2507
    qwen3-30b-a3b-instruct-2507
    基于Qwen3的非思考模式开源模型,相较上一版本(通义千问3-30B-A3B)中英文和多语言整体通用能力有大幅提升。主观开放类任务专项优化,显著更加符合用户偏好,能够提供更有帮助性的回复。
    输入模态:
    输出模态:
    输入:
    ¥0.75/M
    输出:
    ¥3/M
    智能问答
    多语言翻译
  • Qwen: Qwen3 235B A22B Thinking 2507
    qwen3-235b-a22b-thinking-2507
    基于Qwen3的思考模式开源模型,相较上一版本(通义千问3-235B-A22B)逻辑能力、通用能力、知识增强及创作能力均有大幅提升,适用于高难度强推理场景。
    输入模态:
    输出模态:
    输入:
    ¥2/M
    输出:
    ¥20/M
    文本模型
  • Qwen: Qwen3 Next 80B A3B Instruct
    qwen3-next-80b-a3b-instruct
    基于Qwen3的新一代非思考模式开源模型,相较上一版本(通义千问3-235B-A22B-Instruct-2507)中文文本理解能力更佳、逻辑推理能力有增强、文本生成类任务表现更好。
    输入模态:
    输出模态:
    输入:
    ¥1/M
    输出:
    ¥4/M
    文本模型
  • Qwen: Qwen3 Next 80B A3B Thinking
    qwen3-next-80b-a3b-thinking
    基于Qwen3的新一代思考模式开源模型,相较上一版本(通义千问3-235B-A22B-Thinking-2507指令遵循能力有提升、模型总结回复更加精简。
    输入模态:
    输出模态:
    输入:
    ¥1/M
    输出:
    ¥10/M
    文本模型
  • Qwen: Qwen Turbo
    qwen-turbo
    Qwen3系列Turbo模型,实现思考模式和非思考模式的有效融合,可在对话中切换模式。推理能力以更小参数规模比肩QwQ-32B、通用能力显著超过Qwen2.5-Turbo,达到同规模业界SOTA水平。
    输入模态:
    输出模态:
    输入:
    ¥0.3/M
    输出:
    ¥0.6/M
    文本模型
  • Qwen: Qwen3 Max Preview
    qwen3-max-preview
    通义千问3系列Max模型Preview版本,实现思考模式和非思考模式的有效融合。思考模式下在智能体编程能力、常识知识推理能力、数学/科学/通用类推理等能力上均有显著增强
    输入模态:
    输出模态:
    输入:
    ¥6/M
    输出:
    ¥24/M
    文本模型
  • MiniMax: MiniMax M2
    minimax-m2
    为了满足开发者对 Anthropic API 生态的使用需求,我们的 API 新增了对 Anthropic API 格式的支持。通过简单的配置,即可将 MiniMax 的能力接入到 Anthropic API 生态中。
    输入模态:
    输出模态:
    输入:
    ¥2.1/M
    输出:
    ¥8.4/M
    编程
  • MoonShot AI: Kimi K2 Instruct
    kimi-k2-instruct
    输入模态:
    输出模态:
    输入:
    ¥4/M
    输出:
    ¥16/M
    文本模型
  • DeepSeek: DeepSeek V3 0324
    deepseek-v3-0324
    推理能力: 基准测试性能显著提升: MMLU-Pro:75.9→81.2(+5.3) GPQA:59.1 → 68.4 (+9.3) 点赞数:39.6 → 59.4 (+19.8) LiveCodeBench:39.2 → 49.2 (+10.0) 前端Web开发: 提高了代码的可执行性 更美观的网页和游戏前端 汉语写作能力 增强的风格和内容质量 与与 R1 写作风格一致 中长篇写作质量更高 功能增强 改进的多轮交互式重写 优化翻译质量和信函写作 中文搜索功能 增强的报告分析请求,提供更详细的输出 函数调用改进 提高了函数调用的准确性,修复了以前v3版本的问题
    输入模态:
    输出模态:
    输入:
    ¥2/M
    输出:
    ¥8/M
    文本模型
  • MiniMax: MiniMax M2.1
    minimax-m2.1
    强大多语言编程能力,全面升级编程体验(输出速度约 60 tps) MiniMax M2.1 具体模型亮点如下: 卓越多编程语言能力 过去很多模型主要围绕 Python 优化, 但真实世界的系统往往是多语言协作的结果。 在 M2.1 中, 我们系统性提升了 Rust / Java / Golang / C++ / Kotlin / Objective-C / TypeScript / JavaScript 等语言的能力, 多语言任务整体表现达到业内领先水平, 覆盖从底层系统到应用层开发的完整链路。 WebDev 与 AppDev:能力与美学的整体跃迁 针对业界普遍存在的移动端开发短板, M2.1 显著加强了原生 Android / iOS 开发能力。 同时, 我们系统性提升了模型在 Web 与 App 场景中的设计理解与美学表达能力, 能够出色地构建复杂交互、3D科学场景模拟与高质量可视化表达, 推动 vibe coding 成为可持续、可交付的生产实践。 复合指令约束提升,办公场景变为可能 作为开源模型中率先系统性引入 Interleaved Thinking 的模型系列, M2.1 systematic problem-solving 能力再次升级。 模型不仅关注代码执行是否正确, 同时关注模型对“复合指令约束”的整合执行能力, 在真实办公场景具备更高的可用性。 更简洁高效的回复 相比 M2, MiniMax-M2.1 的模型回复以及思维链更加简洁, 在实际编程与交互体验中, 响应速度显著提升, Token 消耗明显下降, 在 AI Coding与Agent驱动的连续工作流中更加流畅和高效。 出色的 Agent / 工具脚手架泛化能力 M2.1 在各类编程工具与 Agent 框架中均有出色表现。在 Claude Code、Droid (Factory AI)、Cline、Kilo Code、Roo Code、BlackBox 等工具中展现一致且稳定的效果, 并对 Skill.md、Claude.md / agent.md / cursorrule、Slash Command 等 Context Management机制提供可靠支持。
    输入模态:
    输出模态:
    输入:
    ¥2.1/M
    输出:
    ¥8.4/M
    编程
  • Qwen: Qwen Coder Turbo
    qwen-coder-turbo
    通义千问系列代码及编程模型是专门用于编程和代码生成的语言模型,推理速度快,成本低。
    输入模态:
    输出模态:
    输入:
    ¥2/M
    输出:
    ¥6/M
    编程
  • Qwen: Qwen3 Coder 480B A35B Instruct
    qwen3-coder-480b-a35b-instruct
    基于Qwen3的代码生成模型,具有强大的Coding Agent能力,代码能力达到开源模型 SOTA。
    输入模态:
    输出模态:
    输入:
    ¥8/M
    输出:
    ¥16/M
    编程
  • Qwen: Qwen MT Lite
    qwen-mt-lite
    基于Qwen3全面升级的基础级文本翻译大模型,支持32个语种互译,模型性能和翻译效果全面升级,并提供更稳定的术语定制、格式还原度、领域提示能力,让译文更精准、自然。
    输入模态:
    输出模态:
    输入:
    ¥0.6/M
    输出:
    ¥1.6/M
    多语言翻译
  • Qwen: Qwen MT Turbo
    qwen-mt-turbo
    基于Qwen3全面升级的轻量级文本翻译大模型,支持92个语种互译,模型性能和翻译效果全面升级,提供更稳定的术语定制、格式还原度、领域提示能力,让译文更精准、自然。
    输入模态:
    输出模态:
    输入:
    ¥0.7/M
    输出:
    ¥1.95/M
    多语言翻译
  • Qwen: Qwen Long
    qwen-long
    Qwen-Long是在通义千问针对超长上下文处理场景的大语言模型,支持中文、英文等不同语言输入,支持最长1000万tokens(约1500万字或1.5万页文档)的超长上下文对话。配合同步上线的文档服务,可支持文本文件( TXT、DOCX、PDF、XLSX、EPUB、MOBI、MD、CSV)和图片文件(BMP、PNG、JPG/JPEG、GIF 以及PDF扫描件)的解析和对话。说明:通过HTTP直接提交请求,支持1M tokens长度,超过此长度建议通过文件方式提交。
    输入模态:
    输出模态:
    输入:
    ¥0.5/M
    输出:
    ¥2/M
    资料解读
    文档分析
  • Qwen: QwQ Plus
    qwq-plus
    通义千问QwQ推理模型增强版,基于Qwen2.5模型训练的QwQ推理模型,通过强化学习大幅度提升了模型推理能力。模型数学代码等核心指标(AIME 24/25、livecodebench)以及部分通用指标(IFEval、LiveBench等)达到DeepSeek-R1 满血版水平。
    输入模态:
    输出模态:
    输入:
    ¥1.6/M
    输出:
    ¥4/M
    科研辅助
    编程
  • MoonShot AI: Kimi K2 Thinking
    kimi-k2-thinking
    kimi-k2-thinking模型是月之暗面提供的具有通用 Agentic能力和推理能力的思考模型,它擅长深度推理,并可通过多步工具调用,帮助解决各类难题。
    输入模态:
    输出模态:
    输入:
    ¥4/M
    输出:
    ¥16/M
    科研辅助
    资料解读
    文档分析
    智能问答
    办公提效
    +1
  • Z.AI: GLM 4.7
    glm-4.7
    智谱最新旗舰,具备更强的编程能力与更稳定的多步骤推理/执行能力。总参数355B,支持长程任务规划、编码、工具协同,问答自然、写作沉浸、创意角色扮演能力强。
    输入模态:
    输出模态:
    输入:
    ¥2/M
    输出:
    ¥8/M
    科技
    金融
    学习辅导
    日常聊天与陪伴
    角色对话
    +2
  • Qwen: Qwen MT Flash
    qwen-mt-flash
    基于Qwen3全面升级的轻量级文本翻译大模型,支持92个语种互译,模型性能和翻译效果全面升级,并提供更稳定的术语定制、格式还原度、领域提示能力,让译文更精准、自然。
    输入模态:
    输出模态:
    输入:
    ¥0.7/M
    输出:
    ¥1.95/M
    学习辅导
    多语言翻译
  • Qwen: Qwen MT Plus
    qwen-mt-plus
    基于Qwen3全面升级的旗舰级翻译大模型,支持92个语种互译,模型性能和翻译效果全面升级,并提供更稳定的术语定制、格式还原度、领域提示能力,让译文更精准、自然。
    输入模态:
    输出模态:
    输入:
    ¥1.8/M
    输出:
    ¥5.4/M
    多语言翻译
  • Qwen: Qwen3 Coder Flash
    qwen3-coder-flash
    基于Qwen3的代码生成模型,继承Qwen3-Coder-Plus的coding agent能力,支持多轮工具交互,重点优化仓库级别理解能力并增加工具调用稳定性。
    输入模态:
    输出模态:
    输入:
    ¥1/M
    输出:
    ¥4/M
    编程
  • Qwen: Qwen3 Coder Plus
    qwen3-coder-plus
    基于Qwen3的代码生成模型,具有强大的Coding Agent能力,擅长工具调用和环境交互,能够实现自主编程、代码能力卓越的同时兼具通用能力。
    输入模态:
    输出模态:
    输入:
    ¥4/M
    输出:
    ¥16/M
    编程
  • Bytedance: Doubao Seed 1.6 Flash
    doubao-seed-1-6-flash-250828
    推理速度极致的多模态深度思考模型,TPOT低至10ms; 同时支持文本和视觉理解,文本理解能力超过上一代lite,视觉理解比肩友商pro系列模型。支持 256k 上下文窗口,输出长度支持最大 16k tokens。
    输入模态:
    输出模态:
    输入:
    ¥0.15/M
    输出:
    ¥1.5/M
    深度思考
  • Qwen: Qwen Max
    qwen-max
    通义千问系列效果最好的模型,中英文code能力、逻辑能力、多语言能力显著提升,回复风格面向人类偏好进行大幅调整,模型回复详实程度和格式清晰度明显改善,创作类专项、json格式遵循专项、角色扮演专项能力定向提升,此模型为通义千问-Max的2025年1月25日快照版本,预计维护至下一个快照上线前一个月。
    输入模态:
    输出模态:
    输入:
    ¥2.4/M
    输出:
    ¥9.6/M
    编程
  • ByteDance: Doubao Seed 1.6
    doubao-seed-1-6-251015
    Doubao-Seed-1.6全新多模态深度思考模型,同时支持minimal/low/medium/high 四种reasoning effort。 更强模型效果,服务复杂任务和有挑战场景。支持 256k 上下文窗口,输出长度支持最大 32k tokens。
    输入模态:
    输出模态:
    输入:
    ¥0.8/M
    输出:
    ¥2/M
    深度思考
  • ByteDance: DouBao 1.5 Pro 32K
    doubao-1-5-pro-32k-250115
    支持文生音画、首帧图生音画、首尾帧图生音画
    输入模态:
    输出模态:
    输入:
    ¥0.8/M
    输出:
    ¥2/M
    文本模型
  • Qwen: Qwen flash
    qwen-flash
    Qwen3系列Flash模型,实现思考模式和非思考模式的有效融合,可在对话中切换模式。复杂推理类任务性能优秀,指令遵循、文本理解等能力显著提高。支持1M上下文长度,按照上下文长度进行阶梯计费。
    输入模态:
    输出模态:
    输入:
    ¥0.15/M
    输出:
    ¥1.5/M
    深度思考
    智能问答
  • Qwen: Qwen Plus
    qwen-plus
    Qwen3系列Plus模型,实现思考模式和非思考模式的有效融合,可在对话中切换模式。推理能力显著超过QwQ、通用能力显著超过Qwen2.5-Plus,达到同规模业界SOTA水平。
    输入模态:
    输出模态:
    输入:
    ¥0.8/M
    输出:
    ¥8/M
    深度思考
  • Qwen: Qwen3 Max
    qwen3-max
    通义千问3系列Max模型,相较preview版本在智能体编程与工具调用方向进行了专项升级。本次发布的正式版模型达到领域SOTA水平,适配场景更加复杂的智能体需求。
    输入模态:
    输出模态:
    输入:
    ¥2.5/M
    输出:
    ¥10/M
    编程