MiniMax 与 fal 合作推出 H3 Max 视频模型
MiniMax 祝贺 fal 团队推出基于其开源模型的后训练视频模型 H3 Max,该模型在质量、提示理解和美学方面排名第一,生成 5 秒 720p 视频仅需不到 3 秒。fal 同时优化了推理系统以实现超实时性能。H3 Max 发布首周享 50% 折扣。
MiniMax 祝贺 fal 团队推出基于其开源模型的后训练视频模型 H3 Max,该模型在质量、提示理解和美学方面排名第一,生成 5 秒 720p 视频仅需不到 3 秒。fal 同时优化了推理系统以实现超实时性能。H3 Max 发布首周享 50% 折扣。
MiniMax 祝贺 fal 团队基于其开源 H3 基础模型后训练的 H3 Max 视频模型登顶多项评测。H3 Max 在整体质量、提示词理解和美学上均排名第一,生成 5 秒 720p 视频耗时低于 3 秒,且本周价格五折。MiniMax 强调后训练只是释放基础模型已有能力,并指出 SGLang 训练管线及 Sol-Attention 引擎带来 3.95 倍端到端加速。
Google 推出 Gemini Omni 1.1 Flash,通过 Gemini API 在 Google AI Studio 提供面向专业用途的生成视频能力。新功能包括场景扩展(可分析最多 10 秒先前上下文,以 10 秒为增量延长至累计 40 秒)、首尾帧插值、360p 快速草稿(比 720p 快至多 60%、成本为其三分之一)以及最高 4K 分辨率升级。
Cohere 发布文档解析模型 Parse(parse-v5.0),基于 North-Micro-Vision-Instruct 架构,拥有 2.3B 参数、8,192-token 上下文窗口和约 4.6GB 体积,可将 PDF、PPT、JPEG 页面直接转为含 HTML 表格和边界框坐标的 Markdown,无需独立 OCR 阶段。
蚂蚁百灵推出金融增强版 Ling-3.0-flash-Fin,总参数 124B、激活参数 5.1B,面向信息检索、研究、估值建模与报告撰写。
Google 将 Gemini Omni Flash 视频模型升级至 1.1 版本,场景扩展可分析现有视频最多十秒而非仅最后一秒,并以 10 秒为增量延长至 40 秒。
很高兴将 Gemini Omni Flash 1.1 带给世界,这是对我们"任意输入、任意输出"世界模型的更新。它现在支持: - 360p 草稿、4K 上采样器 - 扩展时最多 10 秒的视频上下文 - 以 10 秒为增量进行视频扩展 - 视频参考
Google 正式发布多模态视频生成与编辑模型 Gemini Omni 1.1 Flash,现已上线 Gemini API 和 Google AI Studio。新模型为开发者提供场景扩展、指定镜头起止帧、视频输入参考等创意控制,并支持将片段放大至 4K、以 360p 快速测试想法。
Google 发布多模态视频生成与编辑模型 Gemini Omni 1.1 Flash,支持 4K 超分、首尾帧控制及快速 360p 草稿。最大升级是场景扩展:基于原视频 10 秒上下文进行扩展,远超 Veo 的 1 秒,带来更强一致性与更长叙事。
Google 推出 Gemini Omni 1.1 Flash,为开发者提供更强的生成式视频控制能力。新模型支持场景扩展(可分析最多 10 秒先前上下文,以 10 秒为增量累计延长至 40 秒)、指定首尾帧生成平滑过渡,以及 4K 高清输出。
GOOGLE 🔥:Omni 1.1 Flash 视频模型即将发布,支持 1080p 和 4K 输出分辨率选项。 很快推出 👀
Cohere 推出 Parse 5 文档解析模型,主打市场最强性价比。此前企业需在高成本高精度解析与低成本有损解析间取舍,Parse 5 以行业最低每页价格实现高质量解析,适合大规模企业数据处理。
Ox-Alpha🐮 已揭晓。👀 认识来自 @Zai_org 的 GLM-5.3-Flash -- 现已开源,并已在 SiliconFlow 上线。⚡ 一如既往的 Day-0 支持。 总计 320B 参数,仅 18B 激活。原生多模态。MIT 许可。让前沿智能更可及。强于 GLM-5.2。成本降低 90%。编码与智能体任务接近 Opus 4.8。成本降低 >95%。 在 SiliconFlow 上:优化推理、高可用性、生产级规模容量。立即在 SiliconFlow 上构建。🚀
推出 Cohere Parse 5。这是我们最新的文档解析模型,拥有市场上最强的性价比。 非常适合高吞吐量的企业工作。在保持每页价格处于行业低位的同时,获得高质量的解析准确率。
Manycore Tech 发布新 3D 生成模型 Lux3D,最快 20 秒生成 3D 资产,支持高质量材质纹理与 Harness Mode 批量创建。Rohan Paul 指出,其 API 可被编码智能体反复调用,从规格说明批量生成 3D 道具并送入 Blender 处理,使 3D 生成成为更大智能体执行循环中的一环,而非简单的"图生 3D"工具。
Google 推出 Gemini 3.5 Transcribe 语音转文字模型,支持 85 种以上语言,可自动去除"um"等填充词、纠正口误并自动排版。流式转录词错误率为 4.0%,录音音频为 2.6%,延迟较前代 Chirp 3 降低 70%。
智谱于8月26日开源GLM-5.3-Flash,这是GLM-5系列首个原生多模态模型。其线上流量完全运行在10万颗国产芯片上。发布前,匿名"Ox Alpha"模型在OpenRouter和OpenCode上处理了62T token--同样使用中国硬件。据报道,供应商可能包括华为、海光和摩尔线程。该模型在Artificial Analysis上得分为57,与Claude Opus 4.8持平,而成本仅为GLM-5.3的十分之一。开放模型、国产算力、全球需求。
Z.ai 发布 GLM-5.3-Flash,3200 亿总参数(180 亿激活)、百万 token 上下文窗口,MIT 许可开源。该模型在 Intelligence Index 上得 57 分,接近 GLM-5.3 的 60 分,但每任务成本仅 0.09 美元,约为后者的 7.5 分之一。该模型全程运行于国产 AI 芯片,Z.ai 自研服务软件实现了与 Nvidia GPU 相当的性能。
突发:SpaceXAI 的 Grok 4.6 现已上线 Microsoft Foundry Models。 在 Foundry 上使用 Grok 4.6 进行构建,企业组织可在此对比前沿 AI 模型、运行工作负载专项测试、部署托管端点,并以企业级安全与治理管控进行运营。
小鹏第二代 VLA 全新版本将于9月面向Ultra和Ultra SE车型推送,Lite蒸馏版同步开启首批推送,G9L Max首发搭载。该版本基于统一技术底座贯通L2至L4能力,X-Foresight预测世界模型首次上车,可预判未来6秒交通参与者行为,并引入Infini-VLA长时序架构记忆前30秒世界。
小鹏汽车宣布第二代 VLA Lite 蒸馏版将于 9 月开启推送,面向单图灵芯片的 Max 车型,G9L Max 版首发搭载。该版本通过学习式 Token 压缩与蒸馏训练,以更少的有效 Token 实现高质量视觉理解,将基座模型能力部署到算力更低的平台。第二代 VLA 基于统一技术底座,已实现 L2 至 L4 能力贯通。
小鹏在第二代 VLA 全新版本体验日宣布 X-Foresight 预测世界模型首次上车,可预判未来 6 秒周边交通参与者的可能行为,并引用 Flow Matching 预测多种未来。第二代 VLA 还引入 Infini-VLA 长时序架构,可记忆前 30 秒世界,并采用 MoT 混合架构减少场景任务干扰。模型推理效率同步提升,端到端响应提速 300%,实现"边看、边想、边行动"的并行处理。
小鹏集团通用智能中心负责人刘先明在物理 AI 分享会上表示,第二代 VLA 升级的核心是让模型第一次建立起对时间维度的理解。小鹏物理世界基座模型首次将"时间"纳入模型,AI 理解维度从"3D 空间"跃迁至"4D 时空",并引入 Infini-VLA 长时序架构,可记住前 30 秒的世界。第二代 VLA 同步采用流式自回归推理,端到端响应提速 300%,实现"边看、边想、边行动"的并行处理。
Qwen3.8-Flash 已在 @qwen_cloud 上线:输入 $0.15/1M tokens,输出 $0.47/1M tokens,缓存命中仅 $0.016/1M tokens。☁️ 快来试试吧!👇 【引用 @qwen_cloud】:Qwen3.8-Flash API 已在 QwenCloud 上线。原生 262K 上下文,可扩展至 1M,定价适合规模化部署。 价格详情⬇️ 输入:$0.15 / 1M tokens 输出:$0.47 / 1M tokens 缓存命中:$0.016 / 1M tokens 获取你的 API key 并开始构建: https://www.qwencloud.com/models/qwen3.8-flash?utm_content=g_20000002831 #QwenCloud #Qwen
Qwen3.8-Flash 现已上线 @OpenRouter!⚡ 编程助手、智能体工作流、长视频理解,一个 API 调用即可全部实现。
Ox Alpha = GLM-5.3 Flash AA = 57,以1/100的前沿价格, 由纯国产芯片驱动。在OpenRouter上实现了近20%的周token份额(第一)。 感谢大家的支持。
谷歌发布 Gemini 3.5 Transcribe 语音转文本模型,可自动删除"嗯""呃"等口头禅及说错后自行纠正的内容,生成更通顺的文本。相比 Chirp 3,整体速度预计提升约 70%,实时语音场景错误率降至 5.5%,支持 85 种语言及最多 3 名说话者的预录音频。该模型已为 Pixel 11 上 Gboard 的"Rambler"功能提供支持,后续将进入更多谷歌产品。
GLM-5.3 开源权重 22 小时后发布!!! 我很兴奋。
更多好消息:GLM-5.3 的权重将于明日发布。 https://huggingface.co/zai-org/GLM-5.3
Qwen 发布开源多模态 MoE 模型 Qwen3.8-Flash-Next,作为 Qwen4 架构的早期预览。模型总参数 125B,仅激活 6B 参数,带来显著性能提升。作者已在 DGX Spark 上通过 Unsloth 量化版本试用,包括 72.5GB 的 UD-IQ1_S 和 78.9GB 的 UD-Q2_K_XL 版本。
Meta 的 Muse 图像模型现已在 OpenRouter 上线。基于搜索增强,定价面向生产级用量,每张图像 $0.01。 可创建和编辑复杂图像,且保留未修改部分不变,价格极具竞争力,让大规模创意工作成为可能。
智谱正式发布GLM-5.3-Flash,即此前在OpenRouter和OpenCode上爆火的匿名模型OX Alpha。该模型为总参数320B、激活18B的MoE架构,是GLM-5系列首个原生多模态模型,支持图像、视频和文本输入,原生上下文100万。
来自 @Alibaba_Qwen 的 Qwen3.8 Flash 现已上线 OpenRouter。 这是一款多模态推理模型,适用于编程助手、智能体工作流、视觉理解、代码库与文档分析、桌面交互、图表及长视频处理。 https://openrouter.ai/qwen/qwen3.8-flash
我觉得我们应该为下一个模型的发布再办一次派对,5.5 的派对非常有趣。 下一次怎样做才能让它更棒?
Z.ai 发布 GLM-5.3-Flash,这是 GLM-5 系列首款原生多模态模型,320B 总参数、18B 激活参数,支持 100 万 token 上下文和图像/视频输入,权重以 MIT 许可开源在 Hugging Face。
Google 发布 Gemini 3.5 Transcribe,智能转写语音为"实际意图文本",可消除口误、过滤语气词、格式化数字日期并适配自定义词汇。
MiniMax H3 Max(fal 后训练版)在 Artificial Analysis 视频榜登顶图生视频(含音频)第 1、文生视频第 3,均超越基础版 H3。该模型由 fal 构建并托管,生成 5-15 秒带原生音频的 768p 视频,定价 $0.04/秒。fal 计划开源权重,若实现将成为两榜最高排名开源模型。
Google Research 推出 GlucoFM,一款轻量级自监督 CGM 基础模型,采用双流设计分别建模缓慢血糖趋势与短期波动。在四个队列、七项临床预测任务的 14 项评估中,其 PR-AUC 较最优 GluFormer 变体平均高出 5.8 个百分点,并在 PPGR 预测中取得最低 MAE。模型在 109,066 小时无标注 CGM 数据上预训练,具备跨数据集迁移与少样本适应能力。
Google 发布 Gemini 3.5 Transcribe 与 Transcribe Live 两款 API:前者面向预录音频,AA-WER 2.6% 排名第五,处理速度约 84 倍实时;后者面向流式传输,首个最终转录延迟 0.40 秒,WER 4.0%。两者均支持 85+ 语言,预录版支持最多三人带时间戳的说话人识别,价格分别约 $5 与 $9 每千分钟。
Google 发布 Gemini 3.5 Transcribe,用于语音输入的 AI 模型,可去除"嗯"等语气词并润色文本。相比上一代 Chirp 3,语音到最终文本速度提升约 70%,实时语音错误率降至 5.5%。
Perceptron 发布开源具身基础模型 Isaac 0.5,这是一个 36B 参数动态 MoE 模型,通过扩展无动作视频将遥操作需求降低 210 倍。该模型可输入摄像头图像/视频、人类指令和机器人当前状态,输出物体位置、任务进度或下一步动作,既能微调后直接控制机械臂,也可仅用于感知。
阿里通义千问发布 Qwen3.8-Flash-Next,采用与即将推出的 Qwen4 相同的架构创新。包括 510 亿参数的 N-gram Embedding(可将嵌入表卸载至低速廉价 DRAM)、门控残差连接(GR),以及微块粒度选择上下文的 Qwen 稀疏注意力(QSA)。这些创新展示了中国开源模型在残差连接等方向的前沿探索。
Qwen 团队开源新架构,总参数 125B 加 51B 嵌入,每 token 仅激活 6B,训练成本降至上一代 1/9,SWE-bench Pro 拿下 62.5,反超 Claude Opus 4.6 Max 的 53.4。
智谱发布 GLM-5.3-Flash,320B-A18B 参数、原生多模态、1M-token 上下文窗口,MIT 许可开源,此前预览名为 Ox Alpha,完全运行于国产 AI 芯片。DAIR.AI 创始人推荐用 /eli5 制作视觉解释器,并可在其新 agent 游乐场搭配 Pi 或 Hermes Agent 试用。模型权重与 API 已在官方平台开放。
Anthropic 正筹备明日发布,预计推出 Fable 5.1 及可能的 Opus 更新。据 @legit_api,Fable 已开始路由至新版 Fable 5.1,发布在即。@synthwavedd 称若不想难堪,最迟需下周初发布。
智谱发布 GLM-5.3-Flash,320B 总参数、18B 激活参数,在 Artificial Analysis 智能指数上以最大推理强度得 57 分,仅比 GLM-5.3 低 3 分,与 GPT-5.6 Terra 和 Muse Spark 1.2 持平。
推出 Gemini 3.5 Transcribe 🚀 我们最精准的语音转文字模型,支持 85+ 种语言,具备智能纠错和自定义词汇功能。 我用该模型 vibe coding 了一个类似 Wispr Flow 的应用。 演示 + 开源如下!
GOOGLE 🔥:全新的 Gemini 3.5 Transcribe 现已登陆 Google AI Studio、API 以及 macOS 版 Gemini Desktop! > "开箱即用,自动识别 85+ 种语言"
推出 Gemini 3.5 Transcribe,我们全新的语音转文本模型,具备智能转写、函数调用、更精准的转写(更低 WER)、自定义词汇支持、多说话人识别,并支持超过 85 种语言! 同时支持实时流式传输!
Google 推出 Gemini 3.5 Transcribe 语音转写模型,支持 85+ 语言,可自动过滤语气词、格式化非结构化语音,并结合屏幕上下文执行语音指令。该模型还能利用多模态能力将杂乱语音输入和本地文件直接转为邮件草稿。
1581 items