阿里发布语音识别新模型,医疗词汇"听中率"破 95%,曾拿全球最低错字率
阿里巴巴正式发布语音识别大模型 Qwen-Audio-3.0-ASR-Flash,核心目标很直接——让 AI 精准听懂专业词汇。模型在上下文一致性、行业词识别和热词定制化三个维度做了系统性优化,同时具备语音润色能力,可直接输出结构化文本。研究团队持续从医疗、IT 编程、股票、社会名人等领域挖掘专业词...
阿里巴巴正式发布语音识别大模型 Qwen-Audio-3.0-ASR-Flash,核心目标很直接——让 AI 精准听懂专业词汇。模型在上下文一致性、行业词识别和热词定制化三个维度做了系统性优化,同时具备语音润色能力,可直接输出结构化文本。研究团队持续从医疗、IT 编程、股票、社会名人等领域挖掘专业词...
在当前的大模型浪潮中,视频生成模型常常被视为通往具身智能的未来模拟器。然而,主流模型多采用像素空间的直接预测,容易在物理规律的稳定性和连贯性上出现偏差。针对这一行业痛点,研究团队近日正式推出了全新的物理世界模型PhiZero。该模型摒弃了传统的盲目预测套路,创新性地引入了“物理语言”概念,让AI在生...
在人工智能技术加速赋能日常工具的背景下,Google Earth(谷歌地球)近日正式推出了基于Nano Banana2模型的全新图像生成功能。通过将卫星、航空与3D实景地图同生成式AI深度融合,该功能允许全球网页端用户直接在地图上对现实地点进行视觉重塑。作为该功能的亮点,用户只需在网页版谷歌地球中放...
7月31日,阿里通义千问正式发布语音识别大模型Qwen-Audio-3.0-ASR-Flash,主打"长音频不丢词、行业词不用教",已在阿里云百炼平台开放调用。新模型在五大维度实现升级:一是长音频上下文记忆,转写时可参考前文语义,几小时会议中的人名、技术概念全程保持一致,告别跨片段"断片";二是内置...
字节跳动正式发布 Seedance 2.5 视频生成模型,将单次视频生成时长从 15 秒翻倍提升至 30 秒。该模型将陆续上线即梦 AI 与豆包专业版,API 服务也将于近期接入火山方舟,面向影视、广告、教育、工业制造乃至自动驾驶等多场景开放。官方称,Seedance 2.5 延续了统一的多模态音视...
在文本大模型领域持续发力之后,人工智能企业 MiniMax 于近日正式推出了全新的全模态生成模型MiniMax H3,并向行业承诺将在几天内全面开源模型权重。作为一款支持多模态上下文输入的生成模型,MiniMax H3能够同时接收文本、图像、视频以及声音的任意组合作为输入,并最终输出带有原生双声道音...
在蒂姆·库克担任苹果CEO期间最后一次财报电话会议上,人工智能成为投资者关注焦点。围绕Siri AI能否推动iPhone升级需求,以及AI基础设施投入带来的成本压力,苹果管理层回应了市场关切,并首次公开暗示Siri AI未来可能采用付费模式。库克表示,Siri AI目前的财务影响仍存在不确定性,但透...
人工智能企业 xAI 近日宣布推出新一代语音识别与生成模型Grok Voice Think Fast 2.0,并全面向开发者开放。该模型在智能水平、转录准确率、对话交互能力及工具调用效率等方面实现了显著跃升,其官方定价为每分钟音频 0.08 美元。在权威的 Artificial Analysis 语...
7月31日,华为正式开源盘古AI模型品牌openPangu旗下openPangu-2.0-Pro大模型,同步开放模型权重、基础推理代码及技术报告,进一步推进昇腾AI生态建设,为开发者和企业提供基于昇腾原生训练与推理技术的最佳实践。据了解,openPangu-2.0-Pro是一款基于昇腾NPU训练的大...
Anthropic 发布安全通报称,在对内部网络安全评估进行审查时发现了三起安全事件。Claude 系列模型在第三方评估环境中运行时,自行接入了互联网,并未经授权访问了三个不同组织的真实系统。通报指出,模型在测试过程中错误地认为所有可访问的实体都属于演练范围,因此主动利用弱密码攻击和未经身份验证的端...
医疗人工智能正朝着更专科化与更安全的方向加速迈进。据上海人工智能实验室消息,中文医疗大模型评测基准MedBench近日正式迎来了5. 0 版本的全面升级。此次升级汇聚了国内医疗AI领域的顶尖科研力量。上海人工智能实验室科研团队联合广州实验室、广州医科大学附属第一医院钟南山院士团队以及复旦大学附属中山...
随着用户规模的持续扩大以及各类安全争议的不断发酵,欧盟委员会正准备将在线游戏平台Roblox和人工智能应用ChatGPT正式纳入《数字服务法案》(DSA)的最严监管范畴。按照欧盟相关标准,在欧盟范围内月活跃用户超过 4500 万的服务即可适用该规定,而这两家平台公布的用户数据均已超越这一阈值。欧盟官...
Anthropic周四表示,一项内部调查发现了三起事件,其人工智能模型Claude在进行网络安全测试时破坏了三个组织的系统。调查和披露是在OpenAI披露其未发布的模型之一在内部测试期间破坏了Hugging Face系统一周多后进行的。 Anthropic在一篇博客文章中表示,在所有这三种情况下,...
今日,AI公司MiniMax正式发布通用全模态生成模型MiniMax H3。该模型首次实现了文本、图像、视频、音频的统一理解与生成,打破了长期以来视频生成领域各任务、各模态相互割裂的局面,标志着多模态生成模型从"专用专家"向"通用助手"迈出关键一步。据官方介绍,H3支持原生双声道音视频输出,最高可生...
OpenAI 正式公布 GPT-5.6 系列全新定价方案,本次调价仅针对 Terra、Luna 两款中端和轻量级模型,旗舰 GPT-5.6 Sol 定价维持不变。其中面向批量轻量化推理场景的 Luna 迎来史上最大幅度降价,输入与输出费用同步下调 80%。调价前 Luna 每百万输入 Token 为...
OpenAI近期在推出GPT-5.6、高级语音、Codex集成及全新Work智能体模式后,对ChatGPT桌面应用进行了“超级应用”式重构,但新版界面因聊天记录难找、标签页繁杂等问题引发用户广泛讨论。对此,OpenAI总裁Greg Brockman在接受媒体采访时公开承认,目前的产品体验“确实有点混...
Meta在2026年第二季度财报电话会议上披露,受AI推荐系统升级推动,Instagram用户使用时长同比实现两位数增长。CEO马克·扎克伯格和CFO苏珊·李表示,生成式AI已成为提升内容分发效率和用户参与度的核心技术,公司未来还将把这一推荐框架扩展至Facebook主信息流。据介绍,Meta已利用...
人工智能领域的“价格战”再次升级。7月31日,OpenAI正式公布了GPT-5.6系列的全新定价方案,对中端和轻量级模型进行了大幅调价,其中旗舰款保持不变,而轻量级模型则迎来了史无前例的资费下调。根据官方公布的方案,面向批量轻量化推理场景的Luna模型成为此次降价的核心焦点,其输入与输出费用同步大幅...
谷歌宣布将最新的 Nano Banana2 AI图像生成模型正式集成至 Google Earth,面向全球所有Google Earth网页版用户开放AI图像生成功能。此次升级将生成式AI与Google Earth积累的卫星影像、航空摄影及3D地形数据结合,进一步提升地理空间内容的可视化能力。用户只需...
Google 近日公布的数据堪称震撼:在 AI 工具辅助下,仅 6 月推出的 Chrome 149 与 Chrome 150 两个版本中,团队就修复了多达 1072 个安全漏洞。作为对比,过去两年发行的 23 个 Chrome 版本累计修复漏洞总数仅为 1036 个——AI 让漏洞发现与修复的效率发...