Home
Welcome
About
Profile & credentials
The Casebook
Real case studies with measured outcomes
Product Playground
Try a concept. Play with a product.
The Radar
Insights on AI in logistics
AIHot
Real-time AI news feed
The Manifest
Daily AI × supply chain signal
AIHot

All Updates

Models46

MiniMax 与 fal 合作推出 H3 Max 视频模型

Congrats to the fal team on MinMax-H3 Max - fantastic work! fal optimized the model for stronger rea…

MiniMax 祝贺 fal 团队推出基于其开源模型的后训练视频模型 H3 Max,该模型在质量、提示理解和美学方面排名第一,生成 5 秒 720p 视频仅需不到 3 秒。fal 同时优化了推理系统以实现超实时性能。H3 Max 发布首周享 50% 折扣。

X:MiniMax (@MiniMax_AI)·
Models52

MiniMax 开源 H3 基础模型,生态后训练登顶

Congrats to the fal team on MiniMax H3 Max - fantastic work! A quick note on what's actually happen…

MiniMax 祝贺 fal 团队基于其开源 H3 基础模型后训练的 H3 Max 视频模型登顶多项评测。H3 Max 在整体质量、提示词理解和美学上均排名第一,生成 5 秒 720p 视频耗时低于 3 秒,且本周价格五折。MiniMax 强调后训练只是释放基础模型已有能力,并指出 SGLang 训练管线及 Sol-Attention 引擎带来 3.95 倍端到端加速。

X:MiniMax (@MiniMax_AI)·
Models70

Gemini Omni 1.1 Flash 发布:新增场景扩展、4K 升级等生成视频控制能力

Gemini Omni 1.1 Flash

Google 推出 Gemini Omni 1.1 Flash,通过 Gemini API 在 Google AI Studio 提供面向专业用途的生成视频能力。新功能包括场景扩展(可分析最多 10 秒先前上下文,以 10 秒为增量延长至累计 40 秒)、首尾帧插值、360p 快速草稿(比 720p 快至多 60%、成本为其三分之一)以及最高 4K 分辨率升级。

Hacker News 热门(buzzing.cc 中文翻译)·
Models55

Cohere 发布 Parse 5(parse-v5.0):2.3B 视觉语言模型,将企业文档转为 Markdown

Cohere Releases Parse 5 (parse-v5.0): A 2.3B Vision Language Model That Turns Enterprise Documents Into Markdown

Cohere 发布文档解析模型 Parse(parse-v5.0),基于 North-Micro-Vision-Instruct 架构,拥有 2.3B 参数、8,192-token 上下文窗口和约 4.6GB 体积,可将 PDF、PPT、JPEG 页面直接转为含 HTML 表格和边界框坐标的 Markdown,无需独立 OCR 阶段。

MarkTechPost(RSS)·
Models53

蚂蚁百灵发布金融增强模型 Ling-3.0-flash-Fin

Financial work depends on trustworthy sources, consistent definitions, accurate calculations and aud…

蚂蚁百灵推出金融增强版 Ling-3.0-flash-Fin,总参数 124B、激活参数 5.1B,面向信息检索、研究、估值建模与报告撰写。

X:蚂蚁百灵 (@AntLingAGI)·
Models54

Google 发布 Gemini Omni 1.1 Flash,视频生成更便宜更灵活

Google's Gemini Omni 1.1 Flash makes AI video generation cheaper and more flexible

Google 将 Gemini Omni Flash 视频模型升级至 1.1 版本,场景扩展可分析现有视频最多十秒而非仅最后一秒,并以 10 秒为增量延长至 40 秒。

The Decoder:AI News(RSS)·
Models54

Gemini Omni Flash 1.1 发布,支持视频扩展

Excited to bring Gemini Omni Flash 1.1 to the world, this is an update to our anything in, anything …

很高兴将 Gemini Omni Flash 1.1 带给世界,这是对我们"任意输入、任意输出"世界模型的更新。它现在支持: - 360p 草稿、4K 上采样器 - 扩展时最多 10 秒的视频上下文 - 以 10 秒为增量进行视频扩展 - 视频参考

X:Logan Kilpatrick (@OfficialLoganK)·
Models47

Gemini Omni 1.1 Flash 发布,支持 4K 视频生成

GOOGLE 🔥: Gemini Omni 1.1 Flash has been officially announced and now available on Gemini APIs and …

Google 正式发布多模态视频生成与编辑模型 Gemini Omni 1.1 Flash,现已上线 Gemini API 和 Google AI Studio。新模型为开发者提供场景扩展、指定镜头起止帧、视频输入参考等创意控制,并支持将片段放大至 4K、以 360p 快速测试想法。

X:Testing Catalog (@testingcatalog)·
Models61

Gemini Omni 1.1 Flash 发布,场景扩展大升级

Meet Gemini Omni 1.1 Flash ⚡️ Our newest multimodal model for video generation and editing. It now f…

Google 发布多模态视频生成与编辑模型 Gemini Omni 1.1 Flash,支持 4K 超分、首尾帧控制及快速 360p 草稿。最大升级是场景扩展:基于原视频 10 秒上下文进行扩展,远超 Veo 的 1 秒,带来更强一致性与更长叙事。

X:Google AI (@GoogleAI)·
Models70

Gemini Omni 1.1 Flash 发布,为开发者提供更强生成式视频控制

Gemini Omni 1.1 Flash lets you build with more control

Google 推出 Gemini Omni 1.1 Flash,为开发者提供更强的生成式视频控制能力。新模型支持场景扩展(可分析最多 10 秒先前上下文,以 10 秒为增量累计延长至 40 秒)、指定首尾帧生成平滑过渡,以及 4K 高清输出。

Google DeepMind:Blog(RSS)·
Models40

Google 发布 Omni 1.1 Flash 视频模型

GOOGLE 🔥: Omni 1.1 Flash video model is being released with 1080p and 4K output resolution options….

GOOGLE 🔥:Omni 1.1 Flash 视频模型即将发布,支持 1080p 和 4K 输出分辨率选项。 很快推出 👀

X:Testing Catalog (@testingcatalog)·
Models30

Cohere 发布 Parse 5 文档解析模型

Parsing turns out to be one of the biggest bottlenecks to LLMs being able to make effective use of e…

Cohere 推出 Parse 5 文档解析模型,主打市场最强性价比。此前企业需在高成本高精度解析与低成本有损解析间取舍,Parse 5 以行业最低每页价格实现高质量解析,适合大规模企业数据处理。

X:Aidan Gomez(Cohere CEO,@aidangomez)·
Models52

GLM-5.3-Flash 开源上线硅基流动

Ox-Alpha🐮 has been revealed. 👀 Meet GLM-5.3-Flash from @Zai_org - now open source, and already liv…

Ox-Alpha🐮 已揭晓。👀 认识来自 @Zai_org 的 GLM-5.3-Flash -- 现已开源,并已在 SiliconFlow 上线。⚡ 一如既往的 Day-0 支持。 总计 320B 参数,仅 18B 激活。原生多模态。MIT 许可。让前沿智能更可及。强于 GLM-5.2。成本降低 90%。编码与智能体任务接近 Opus 4.8。成本降低 >95%。 在 SiliconFlow 上:优化推理、高可用性、生产级规模容量。立即在 SiliconFlow 上构建。🚀

X:硅基流动 SiliconFlow (@SiliconFlowAI)·
Models46

Cohere 发布 Parse 5 文档解析模型

Introducing Cohere Parse 5. Our newest document parsing model with the strongest price-performance o…

推出 Cohere Parse 5。这是我们最新的文档解析模型,拥有市场上最强的性价比。 非常适合高吞吐量的企业工作。在保持每页价格处于行业低位的同时,获得高质量的解析准确率。

X:Cohere(@cohere)·
Models36

Lux3D:3D 生成正从"提示词"走向"API 调用"

The next step for 3D models is probably fewer prompts and more API calls. Lux3D points in that dire…

Manycore Tech 发布新 3D 生成模型 Lux3D,最快 20 秒生成 3D 资产,支持高质量材质纹理与 Harness Mode 批量创建。Rohan Paul 指出,其 API 可被编码智能体反复调用,从规格说明批量生成 3D 道具并送入 Blender 处理,使 3D 生成成为更大智能体执行循环中的一环,而非简单的"图生 3D"工具。

X:Rohan Paul (@rohanpaul_ai)·
Models62

Google 发布 Gemini 3.5 Transcribe,支持 85 种语言实时语音转文字

Google's Gemini 3.5 Transcribe turns speech to text in 85 languages while auto-correcting your verbal stumbles

Google 推出 Gemini 3.5 Transcribe 语音转文字模型,支持 85 种以上语言,可自动去除"um"等填充词、纠正口误并自动排版。流式转录词错误率为 4.0%,录音音频为 2.6%,延迟较前代 Chirp 3 降低 70%。

The Decoder:AI News(RSS)·
Models56

智谱开源GLM-5.3-Flash,国产芯片驱动

Zhipu open-sourced GLM-5.3-Flash on Aug. 26, the GLM-5 series' first native multimodal model. Its on…

智谱于8月26日开源GLM-5.3-Flash,这是GLM-5系列首个原生多模态模型。其线上流量完全运行在10万颗国产芯片上。发布前,匿名"Ox Alpha"模型在OpenRouter和OpenCode上处理了62T token--同样使用中国硬件。据报道,供应商可能包括华为、海光和摩尔线程。该模型在Artificial Analysis上得分为57,与Claude Opus 4.8持平,而成本仅为GLM-5.3的十分之一。开放模型、国产算力、全球需求。

X:X.PIN (@thexpin)·
Models69

GLM-5.3-Flash 发布:3200 亿参数、百万上下文,成本仅为 GLM-5.3 的约 1/7.5

GLM-5.3-Flash matches top models at a fraction of the cost, and runs without Nvidia

Z.ai 发布 GLM-5.3-Flash,3200 亿总参数(180 亿激活)、百万 token 上下文窗口,MIT 许可开源。该模型在 Intelligence Index 上得 57 分,接近 GLM-5.3 的 60 分,但每任务成本仅 0.09 美元,约为后者的 7.5 分之一。该模型全程运行于国产 AI 芯片,Z.ai 自研服务软件实现了与 Nvidia GPU 相当的性能。

The Decoder:AI News(RSS)·
Models45

Grok 4.6 登陆微软 Foundry 平台

BREAKING: Grok 4.6 from SpaceXAI is now available in Microsoft Foundry Models. Build with Grok 4.6 …

突发:SpaceXAI 的 Grok 4.6 现已上线 Microsoft Foundry Models。 在 Foundry 上使用 Grok 4.6 进行构建,企业组织可在此对比前沿 AI 模型、运行工作负载专项测试、部署托管端点,并以企业级安全与治理管控进行运营。

X:cb_doge (@cb_doge)·
Models55

小鹏第二代 VLA 全新版本 9 月推送,面向所有 Ultra / Ultra SE 车型

小鹏第二代 VLA 全新版本将于9月面向Ultra和Ultra SE车型推送,Lite蒸馏版同步开启首批推送,G9L Max首发搭载。该版本基于统一技术底座贯通L2至L4能力,X-Foresight预测世界模型首次上车,可预判未来6秒交通参与者行为,并引入Infini-VLA长时序架构记忆前30秒世界。

IT之家(RSS)·
Models43

小鹏第二代 VLA Lite 蒸馏版 9 月推送,G9L Max 版首发搭载

小鹏第二代 VLA Lite 蒸馏版 9 月面向单图灵芯片 Max 车型推送,G9L Max 版首发搭载

小鹏汽车宣布第二代 VLA Lite 蒸馏版将于 9 月开启推送,面向单图灵芯片的 Max 车型,G9L Max 版首发搭载。该版本通过学习式 Token 压缩与蒸馏训练,以更少的有效 Token 实现高质量视觉理解,将基座模型能力部署到算力更低的平台。第二代 VLA 基于统一技术底座,已实现 L2 至 L4 能力贯通。

IT之家(RSS)·
Models55

小鹏 X-Foresight 预测世界模型首次上车,可预判未来 6 秒交通参与者行为

小鹏 X-Foresight 预测世界模型首次上车,可预判未来 6 秒会发生什么

小鹏在第二代 VLA 全新版本体验日宣布 X-Foresight 预测世界模型首次上车,可预判未来 6 秒周边交通参与者的可能行为,并引用 Flow Matching 预测多种未来。第二代 VLA 还引入 Infini-VLA 长时序架构,可记忆前 30 秒世界,并采用 MoT 混合架构减少场景任务干扰。模型推理效率同步提升,端到端响应提速 300%,实现"边看、边想、边行动"的并行处理。

IT之家(RSS)·
Models50

小鹏刘先明:第二代 VLA 升级核心是让模型首次建立对时间维度的理解

小鹏刘先明:第二代 VLA 升级的核心,是让模型第一次建立起对时间维度的理解

小鹏集团通用智能中心负责人刘先明在物理 AI 分享会上表示,第二代 VLA 升级的核心是让模型第一次建立起对时间维度的理解。小鹏物理世界基座模型首次将"时间"纳入模型,AI 理解维度从"3D 空间"跃迁至"4D 时空",并引入 Infini-VLA 长时序架构,可记住前 30 秒的世界。第二代 VLA 同步采用流式自回归推理,端到端响应提速 300%,实现"边看、边想、边行动"的并行处理。

IT之家(RSS)·
Models42

Qwen3.8-Flash 上线,超低价格引关注

Qwen3.8-Flash on @qwen_cloud: $0.15/1M input tokens, $0.47/1M output tokens, and just $0.016/1M on c…

Qwen3.8-Flash 已在 @qwen_cloud 上线:输入 $0.15/1M tokens,输出 $0.47/1M tokens,缓存命中仅 $0.016/1M tokens。☁️ 快来试试吧!👇 【引用 @qwen_cloud】:Qwen3.8-Flash API 已在 QwenCloud 上线。原生 262K 上下文,可扩展至 1M,定价适合规模化部署。 价格详情⬇️ 输入:$0.15 / 1M tokens 输出:$0.47 / 1M tokens 缓存命中:$0.016 / 1M tokens 获取你的 API key 并开始构建: https://www.qwencloud.com/models/qwen3.8-flash?utm_content=g_20000002831 #QwenCloud #Qwen

X:通义千问 / Qwen (@Alibaba_Qwen)·
Models50

Qwen3.8-Flash上线OpenRouter

Qwen3.8-Flash is now live on @OpenRouter! ⚡ Coding assistants, agentic workflows, long-video underst…

Qwen3.8-Flash 现已上线 @OpenRouter!⚡ 编程助手、智能体工作流、长视频理解,一个 API 调用即可全部实现。

X:通义千问 / Qwen (@Alibaba_Qwen)·
Models71

唐杰宣布GLM-5.3 Flash AA登顶OpenRouter

Ox Alpha = GLM-5.3 Flash AA = 57 , 1/100 frontier price, Powered by pure Chinese chips. Delivered…

Ox Alpha = GLM-5.3 Flash AA = 57,以1/100的前沿价格, 由纯国产芯片驱动。在OpenRouter上实现了近20%的周token份额(第一)。 感谢大家的支持。

X:唐杰(@jietang)·
Models62

谷歌发布 Gemini 3.5 Transcribe 语音转文本模型,能自动删除口头禅

谷歌发布 Gemini 3.5 Transcribe 语音转文本模型,可自动删除"嗯""呃"等口头禅及说错后自行纠正的内容,生成更通顺的文本。相比 Chirp 3,整体速度预计提升约 70%,实时语音场景错误率降至 5.5%,支持 85 种语言及最多 3 名说话者的预录音频。该模型已为 Pixel 11 上 Gboard 的"Rambler"功能提供支持,后续将进入更多谷歌产品。

IT之家(RSS)·
Models36

GLM-5.3 开源权重 22 小时后发布

GLM-5.3 open weights in 22 hours!!! I'm excited.

GLM-5.3 开源权重 22 小时后发布!!! 我很兴奋。

X:Yuchen Jin (@Yuchenj_UW)·
Models41

智谱 GLM-5.3 权重明日开源

More good news: GLM-5.3's weights will be released tomorrow. https://huggingface.co/zai-org/GLM-5.3

更多好消息:GLM-5.3 的权重将于明日发布。 https://huggingface.co/zai-org/GLM-5.3

X:智谱 Z.ai (@Zai_org)·
Models65

Qwen3.8-Flash-Next 发布:Qwen 开源多模态 MoE 模型,提前预览 Qwen4 架构

Qwen3.8-Flash-Next

Qwen 发布开源多模态 MoE 模型 Qwen3.8-Flash-Next,作为 Qwen4 架构的早期预览。模型总参数 125B,仅激活 6B 参数,带来显著性能提升。作者已在 DGX Spark 上通过 Unsloth 量化版本试用,包括 72.5GB 的 UD-IQ1_S 和 78.9GB 的 UD-Q2_K_XL 版本。

Simon Willison 博客·
Models44

Meta Muse 图像模型上线 OpenRouter

Muse Image from @AIatMeta is now available on OpenRouter. Grounded by search and priced for producti…

Meta 的 Muse 图像模型现已在 OpenRouter 上线。基于搜索增强,定价面向生产级用量,每张图像 $0.01。 可创建和编辑复杂图像,且保留未修改部分不变,价格极具竞争力,让大规模创意工作成为可能。

X:OpenRouter (@OpenRouter)·
Models78

智谱发布GLM-5.3-Flash,匿名模型OX Alpha正式亮相

这一次,智谱用GLM-5.3-Flash实现了真正的智能平权。

智谱正式发布GLM-5.3-Flash,即此前在OpenRouter和OpenCode上爆火的匿名模型OX Alpha。该模型为总参数320B、激活18B的MoE架构,是GLM-5系列首个原生多模态模型,支持图像、视频和文本输入,原生上下文100万。

公众号:数字生命卡兹克·
Models50

通义千问 Qwen3.8 Flash 上线 OpenRouter

Qwen3.8 Flash from @Alibaba_Qwen is now live on OpenRouter. A multimodal reasoning model for coding…

来自 @Alibaba_Qwen 的 Qwen3.8 Flash 现已上线 OpenRouter。 这是一款多模态推理模型,适用于编程助手、智能体工作流、视觉理解、代码库与文档分析、桌面交互、图表及长视频处理。 https://openrouter.ai/qwen/qwen3.8-flash

X:OpenRouter (@OpenRouter)·
Models21

Sam Altman 提议为下个模型再办发布会

i think we should do another party for our next model release, the 5.5 party was a lot of fun. what…

我觉得我们应该为下一个模型的发布再办一次派对,5.5 的派对非常有趣。 下一次怎样做才能让它更棒?

X:Sam Altman (@sama)·
Models54

Gemini 3.5 Transcribe 发布,智能转写 API 上线

Incrdible release from Google, and one more friction gone from ditching my keyboard. Also looks lik…

Google 发布 Gemini 3.5 Transcribe,智能转写语音为"实际意图文本",可消除口误、过滤语气词、格式化数字日期并适配自定义词汇。

X:Rohan Paul (@rohanpaul_ai)·
Models63

MiniMax H3 Max登顶图生视频榜

MiniMax H3 Max, a post-trained version of MiniMax H3 developed by fal, debuts at #1 in Image to Vide…

MiniMax H3 Max(fal 后训练版)在 Artificial Analysis 视频榜登顶图生视频(含音频)第 1、文生视频第 3,均超越基础版 H3。该模型由 fal 构建并托管,生成 5-15 秒带原生音频的 768p 视频,定价 $0.04/秒。fal 计划开源权重,若实现将成为两榜最高排名开源模型。

X:Artificial Analysis (@ArtificialAnlys)·
Models63

GlucoFM:面向连续血糖监测的基础模型

GlucoFM: Foundation model for continuous glucose monitoring

Google Research 推出 GlucoFM,一款轻量级自监督 CGM 基础模型,采用双流设计分别建模缓慢血糖趋势与短期波动。在四个队列、七项临床预测任务的 14 项评估中,其 PR-AUC 较最优 GluFormer 变体平均高出 5.8 个百分点,并在 PPGR 预测中取得最低 MAE。模型在 109,066 小时无标注 CGM 数据上预训练,具备跨数据集迁移与少样本适应能力。

Google Research:Blog(网页)·
Models64

Gemini 3.5 Transcribe 发布,AA-WER 2.6% 排名第五

Google has released Gemini 3.5 Transcribe, ranking #5 on AA-WER at 2.6%, alongside Gemini 3.5 Transc…

Google 发布 Gemini 3.5 Transcribe 与 Transcribe Live 两款 API:前者面向预录音频,AA-WER 2.6% 排名第五,处理速度约 84 倍实时;后者面向流式传输,首个最终转录延迟 0.40 秒,WER 4.0%。两者均支持 85+ 语言,预录版支持最多三人带时间戳的说话人识别,价格分别约 $5 与 $9 每千分钟。

X:Artificial Analysis (@ArtificialAnlys)·
Models58

Google 推出 Gemini 3.5 Transcribe 语音转文本 AI 模型

Google announces Gemini 3.5 Transcribe for AI-powered speech-to-text

Google 发布 Gemini 3.5 Transcribe,用于语音输入的 AI 模型,可去除"嗯"等语气词并润色文本。相比上一代 Chirp 3,语音到最终文本速度提升约 70%,实时语音错误率降至 5.5%。

Ars Technica:AI(RSS)·
Models50

Perceptron 开源具身基础模型 Isaac 0.5,将遥操作需求降低 210 倍

Brilliant open-source robotics foundation-model release from @perceptroninc . Isaac 0.5 cuts teleop…

Perceptron 发布开源具身基础模型 Isaac 0.5,这是一个 36B 参数动态 MoE 模型,通过扩展无动作视频将遥操作需求降低 210 倍。该模型可输入摄像头图像/视频、人类指令和机器人当前状态,输出物体位置、任务进度或下一步动作,既能微调后直接控制机械臂,也可仅用于感知。

X:Rohan Paul (@rohanpaul_ai)·
Models51

Qwen3.8-Flash-Next 发布,融合 Qwen4 架构创新

Congrats to @Alibaba_Qwen on the release of Qwen3.8-Flash-Next, using the same architecture innovati…

阿里通义千问发布 Qwen3.8-Flash-Next,采用与即将推出的 Qwen4 相同的架构创新。包括 510 亿参数的 N-gram Embedding(可将嵌入表卸载至低速廉价 DRAM)、门控残差连接(GR),以及微块粒度选择上下文的 Qwen 稀疏注意力(QSA)。这些创新展示了中国开源模型在残差连接等方向的前沿探索。

X:SemiAnalysis (@SemiAnalysis_)·
Models50

Qwen 新架构开源:125B 总参仅激活 6B

感觉牛来可能会是一个超级大IP, 如果导演允许大家二创, 大家搓出来一个牛来宇宙都有可能, 比如超牛,豹拉大战牛来……

Qwen 团队开源新架构,总参数 125B 加 51B 嵌入,每 token 仅激活 6B,训练成本降至上一代 1/9,SWE-bench Pro 拿下 62.5,反超 Claude Opus 4.6 Max 的 53.4。

X:阿易 AI Notes (@AYi_AInotes)·
Models46

GLM-5.3-Flash 发布,支持 1M 上下文与 MIT 许可

Want to test how good GLM-5.3-Flash is? I have been finding it useful for visual explainers using /…

智谱发布 GLM-5.3-Flash,320B-A18B 参数、原生多模态、1M-token 上下文窗口,MIT 许可开源,此前预览名为 Ox Alpha,完全运行于国产 AI 芯片。DAIR.AI 创始人推荐用 /eli5 制作视觉解释器,并可在其新 agent 游乐场搭配 Pi 或 Hermes Agent 试用。模型权重与 API 已在官方平台开放。

X:Elvis Saravia (@omarsar0, DAIR.AI)·
Models39

Anthropic 明日发布 Fable 5.1 及 Opus 更新

It looks like Anthropic is preparing a release for tomorrow. Presumably Fable 5.1 and possibly an Op…

Anthropic 正筹备明日发布,预计推出 Fable 5.1 及可能的 Opus 更新。据 @legit_api,Fable 已开始路由至新版 Fable 5.1,发布在即。@synthwavedd 称若不想难堪,最迟需下周初发布。

X:Kim (@kimmonismus)·
Models67

GLM-5.3-Flash 发布:低成本登顶性价比前沿

GLM-5.3-Flash scores 57 on the Artificial Analysis Intelligence Index. At $0.09 Cost per Task, it si…

智谱发布 GLM-5.3-Flash,320B 总参数、18B 激活参数,在 Artificial Analysis 智能指数上以最大推理强度得 57 分,仅比 GLM-5.3 低 3 分,与 GPT-5.6 Terra 和 Muse Spark 1.2 持平。

X:Artificial Analysis (@ArtificialAnlys)·
Models49

Gemini 3.5 Transcribe 发布,支持85+语言

Introducing Gemini 3.5 Transcribe 🚀 Our most precise speech to text model, that can handle over 8…

推出 Gemini 3.5 Transcribe 🚀 我们最精准的语音转文字模型,支持 85+ 种语言,具备智能纠错和自定义词汇功能。 我用该模型 vibe coding 了一个类似 Wispr Flow 的应用。 演示 + 开源如下!

X:Ammaar Reshi (@ammaar)·
Models47

Gemini 3.5 Transcribe 上线 AI Studio 与桌面端

GOOGLE 🔥: A new Gemini 3.5 Transcribe is now available on Google AI Studio and APIs as well as Gemi…

GOOGLE 🔥:全新的 Gemini 3.5 Transcribe 现已登陆 Google AI Studio、API 以及 macOS 版 Gemini Desktop! > "开箱即用,自动识别 85+ 种语言"

X:Testing Catalog (@testingcatalog)·
Models66

Gemini 3.5 Transcribe 发布,支持实时流式转写

Introducing Gemini 3.5 Transcribe, our new speech to text model with smart transcription, function c…

推出 Gemini 3.5 Transcribe,我们全新的语音转文本模型,具备智能转写、函数调用、更精准的转写(更低 WER)、自定义词汇支持、多说话人识别,并支持超过 85 种语言! 同时支持实时流式传输!

X:Logan Kilpatrick (@OfficialLoganK)·
Models59

Gemini 3.5 Transcribe 发布,精准语音转写

Today we're introducing Gemini 3.5 Transcribe, our latest transcription model built for incredibly p…

Google 推出 Gemini 3.5 Transcribe 语音转写模型,支持 85+ 语言,可自动过滤语气词、格式化非结构化语音,并结合屏幕上下文执行语音指令。该模型还能利用多模态能力将杂乱语音输入和本地文件直接转为邮件草稿。

X:Google AI (@GoogleAI)·

1581 items