AIPG Brief · NAS Snapshot

视频

视频频道 · NAS 自动采集与归类

76 条快照 4 个频道 104 个来源 08-08 10:51 更新时间
精选 精选深读 4 篇已发布 · 点击查看精选 DeepSeek投资宇树,双方将在AI和机器人上深度合作
IT之家 63 分

运营商低价时代终结!三大运营商停售互联网渠道卡

运营商低价时代结束了:中国联通杭州渠道佣金骤减超四成,低价宽带套餐下架,资费最高涨超180%,三大运营商也停止第三方互联网渠道售卡。同日,百胜中国用12亿美元买断必胜客中国内地品牌,从借牌经营变成自主品牌,预计每年新增超800家门店。腾讯和米哈游宣布首次游戏联动,《使命召唤手游》9月将与《崩坏3》联动。AI方面,寒武纪上半年净利润增长122.61%,字节上线Seedance 2.5视频模型API,但AI艺人“方桃子”带货美瞳广告却因不实宣传被下架。

点击打开视频 查看视频来源
展开阅读

## 通信行业变天 早报最重磅的信息来自通信行业。中国联通杭州渠道佣金骤减超四成,多款低价宽带套餐下架,资费最高涨幅超过180%,比如融合宽带月租从28元涨到79元。同时,三大运营商停止第三方互联网渠道售卡。早报用运营商低价竞争时代终结来概括这一变化。对于普通用户来说,线上超低价套餐的选择会越来越少,运营商的竞争重点正从拼价格转向拼服务与权益。 ## 商业并购与游戏联动 百胜中国以12亿美元收购必胜客中国内地品牌所有权。交易完成后,百胜中国从特许经营商转变为品牌所有者,能节约特许经营成本、提升利润率,同时提速门店扩张,预计每年新增超800家必胜客门店。这是国内餐饮巨头加强自有品牌控制权的一大步。 游戏方面,腾讯和米哈游完成首次联动:《使命召唤手游》将在9月与《崩坏3》开启联动。一个是腾讯天美和动视暴雪联合开发的射击游戏,一个是米哈游旗舰作品,两大厂首次牵手,对玩家和行业都很有看点。 ## AI与科技新动向 AI是今天早报的另一大主题。AI芯片公司寒武纪公布2026上半年业绩,归母净利润23.11亿元,同比增长122.61%,营收59.96亿元,同比增长108.13%,说明AI算力需求正在快速兑现业绩。字节跳动上线Seedance 2.5视频模型API,原生支持30秒视频直出,进一步降低视频生成门槛。小米也开售智能摄像机4 Max AI变焦版,主打AI看护大模型,能分析儿童、老人、宠物状态并自动生成报告。 但AI并非没有风险。AI艺人“方桃子”在带货美瞳广告中声称“戴了一天都很舒服”,与产品实际体验可能不符,广告最终被下架。这提醒所有使用AI虚拟人做营销的品牌,AI内容同样要遵守广告法。

视频 ai telecom gaming
雷锋网 70 分

阿里视频大模型Wan3.0公测:文档、PPT也能直接变成视频

阿里视频生成大模型 Wan3.0 正式开启公测。以前我们用文字、图片生成视频,现在文档、PPT、PDF 也能直接变成视频,而且单次能生成 30 秒,够讲一个完整故事。它在人像真实感上也下了功夫,追求“千人千面”,表情和肢体动作更自然。这次升级让 AI 视频从“做一个镜头”变成“讲一段故事”,对做课件、演示、汇报的人来说是个生产力级别的变化。目前已在阿里云百炼、万镜一刻等平台开放,API 按秒收费,480P 每秒 0.3 元起。

点击打开视频 查看视频来源
展开阅读

## 背景 8月6日,阿里视频生成大模型 Wan3.0 开始公测。这次升级重点在生成时长、输入方式、参考能力和真实感上,目的是让 AI 视频从“做一个镜头”变成“讲一段完整故事”。 ## 关键细节 Wan3.0 这次最直观的变化是单次能生成 30 秒视频,连续运镜、一镜到底这类复杂镜头也能表达出来。它还有智能时长功能,可以根据提示词自动推荐视频长度。输入方面,除了文字、图片、音频、视频,它首次支持 doc、xls、ppt、pdf、md 等文档格式,单个文件或链接不超过 100MB、50 页。比如上传一个智能眼镜产品的 PPT,配上提示词,就能生成一条完整的形象片。 真人效果也是重点。生成的人像强调“千人千面”,五官和皮肤细节更敏锐,情绪表达自然克制,微表情和肢体动作会联动。全能参考模式下,角色、道具、声音、空间关系、风格等细节都能稳定保持。视频编辑能力也提升了,可以改画面、剧情和台词。不过文中也提到,声音质感和文字准确度还有进步空间。 ## 影响 对普通用户来说,做课件、产品演示、业务汇报可能不再需要从零剪视频,上传文档加提示词就行。对行业来说,这代表着视频生成模型正在变成生产力工具,不只是生成一段好玩的画面。目前 Wan3.0 已在阿里云百炼、万镜一刻、万相官网、千问创作 PC 端、IF STUDIO 和堆友开启公测,千问 APP 灰度开放。API 接口即将全量开放,价格按生成分辨率区分:480P 每秒 0.3 元,720P 每秒 0.6 元,1080P 每秒 1.2 元。

视频 wan3.0 alibaba video-generation
IT之家 62 分

即日起,ChatGPT 能直接调用 Photoshop、Lightroom 修图设计了

Adobe 和 OpenAI 的合作升级了,现在 ChatGPT 里装个插件,就能直接调用 Photoshop、Premiere、Lightroom 等 70 多款 Adobe 工具。你只要在对话框里输入“@Adobe”加上具体任务,AI 就会帮你操作,比如修图、剪视频、做 PDF。这个插件和 OpenAI 的 Codex 编程应用及 Work 套件配合最好,不登录 Creative Cloud 也能用基本功能,登录后还能保存进度、访问云端文件。Adobe 强调这不会取代专业软件,但意味着以后用聊天的方式就能搞定不少创意活了。

点击打开视频 查看视频来源
展开阅读

## 背景 Adobe 去年就用 OpenAI 的 Apps SDK 把 Photoshop、Acrobat 和 Express 接入了 ChatGPT,但当时功能有限。这次合作范围大幅扩大,新插件几乎覆盖了 Adobe 旗下全套创意软件。现在 ChatGPT 里能直接调用超过 70 款 Adobe 工具,包括 Premiere、Lightroom、Illustrator 和 InDesign 等,几乎把整个设计工具箱搬进了聊天窗口。 ## 细节 使用起来很简单:打开 ChatGPT 的设置,在插件页面添加 Adobe 插件,之后在输入框里打“@Adobe”加上具体任务就行,比如“修一下这张图”或“做一个 15 秒营销视频”。Adobe 表示,这个插件和 OpenAI 的 Codex 编程应用、以及最近发布的 Work 套件搭配使用效果最佳。不用登录 Creative Cloud 账号也能用基本功能,但登录后可以跨会话保存工作进度,还能直接访问云端文件。如果登录 Creative Cloud,还能调用 Adobe Firefly 的生成式 AI 模型,让聊天过程中也能用到生成式 AI 的能力。 ## 影响 Adobe 的想法很明确:用户在哪里工作,就把工具送到哪里。他们并不打算让 ChatGPT 取代专业软件。Adobe 负责 Firefly 和智能体 AI 的副总裁福雷斯特·基明确说,ChatGPT 里的插件不是创意专业人士日常依赖的旗舰应用的替代品,需要精细操作和掌控创作过程时,还得用原生应用。不过这确实是创意软件使用方式的一个重要转变——以后普通人或小团队也许用聊天就能完成不少设计、修图和视频剪辑的工作,大大降低了使用门槛。

视频 chatgpt adobe photoshop
雷锋网 73 分

李飞飞和Yilun Du罕见联手:别给机器人建大脑了,直接借视频模型就行

李飞飞、Yilun Du 等一批顶尖AI学者罕见联手,发了一篇叫 MVA 的论文,讲的是:机器人不用专门训自己的大模型,直接借现成的视频生成模型就能学会干活。过去视频模型“懂物理但不懂动作”,原因是动作没法翻译给它听。这篇论文把机器人动作变成视频里的色块轨迹,让模型做“完形填空”,既能预测世界,也能反推动作。只微调了15小时数据,机器人就能从训练时没见过的单臂泛化到双臂干活,效果还远超传统方法。这个思路一旦走通,很多靠堆机器人数据做“机器人大脑”的公司可能都要重新洗牌

点击打开视频 查看视频来源
展开阅读

## 背景 最近挂在 arXiv 上的论文 MVA(Masked Visual Actions for Unified World Modeling) 相当罕见:李飞飞、吴佳俊、ControlNet 作者张吕民、哈佛助理教授 Yilun Du 等一批顶尖学者共同署名。阵容豪华之外,更值得注意的是,李飞飞和 Yilun Du 原本是具身智能两条路线的代表人物,学术交集很少,这次同署一篇论文,通常意味着两条路线找到了一个共同认可的交叉点。现在不少公司在花大价钱训练“机器人大脑”基座模型,而这篇论文挑战的正是这种思路:机器人可能根本不需要专属大模型,也不用重训已有视频生成模型。 ## 关键细节 整套方法的核心,是把“动作”翻译成视频模型本来就能读懂的像素语言。论文用 Meta 的 SAM 工具把机器人和物体从视频里分割出来,形成随时间变化的色块运动轨迹;再把其中一条轨迹遮住,让模型做“完形填空”。遮住物体轨迹时,模型扮演世界模拟器,预测世界怎么变;遮住机械臂轨迹时,模型反推动作,扮演动作生成器。整个过程用同一个模型、同一套参数完成。MVA 没有从零训模型,而是站在阿里开源视频生成模型 Wan2.2 的肩膀上,只用 LoRA 微调了15小时数据,就让机器人做到单臂训练、双臂零样本泛化;在 LPIPS 指标上跑出 0.0945,对比方法 Ctrl-World 是 0.362,效果拉开近四倍。另一个产业界很关注的设计是引入 URDF 机器人描述文件:模型先想清楚末端要去哪,再用逆运动学算出各个关节怎么动,所以换不同型号的机械臂,也不需要重新训练。 ## 影响 论文的产业意义可能比学术意义更大。有机器人产品技术负责人指出,这篇文章核心不是模型训得多好,而是解决了异构机械手之间的泛化和迁移问题,这正好契合今年具身智能“把视觉和动作拆开”的趋势:视觉用海量互联网视频训练,动作用较少的机器人数据加运动学计算补齐。如果这套思路走通,工厂或物流场景里“换条机械臂就宕机”的跨本体难题可能被彻底解决;那些靠专属机器人基座模型撑起高估值的公司,也会受到真金白银的挑战。当然,论文还只是挂在 arXiv 上的预印本,效果有待同行评议和大规模验证,但顶级学者同时押注这个方向,已经是一个值得继续跟踪的信号

视频 embodied-ai robotics video-generation
雷锋网 65 分

金刚GC3芯片重新定义视频AI算力规则,国产RISC-V高端算力商业化提速

金刚GC3,全球首款RISC-V数据流架构的视频AI芯片,刚在无锡的芯片大会上亮相。它不走CPU/GPU的老路,而是让数据自己“跑”起来,避免了来回搬数据的浪费。单芯片支持128路视频硬解码,INT8算力200 TOPS,在视频AI推理上能和主流GPU掰手腕,功耗却更低。这件事很提气,因为它证明国产芯片不用在通用赛道上追着英伟达跑,在视频这个具体场景里也能筑起自己的护城河

点击打开视频 查看视频来源
展开阅读

## 背景 在CCF芯片大会上,专家们讨论到摩尔定律逼近极限,传统靠堆核心、拼频率的路子越来越难走。视频AI已成为算力消耗的大头,而CPU、GPU这些通用芯片天生不适合处理视频流,因为数据搬运太费劲。中科通量的总工程师罗鑫算了笔账:视频处理中,数据搬运消耗的能量往往是实际计算的数倍,这就像用三轮车运集装箱,根本跑不动。 ## 细节 金刚GC3就是来解这个问题的。它基于RISC-V架构12核设计,主频2.0GHz,INT8算力200 TOPS,支持128路1080P@30fps硬解码和64路硬编码。更关键的是它的数据流架构:没有程序计数器,数据一到位就开始算,不用像传统芯片那样反复读写内存。上海交大教授冷静文评价,它在视频AI推理上可以和主流GPU掰手腕,同等功耗下的视频处理密度更是杀手锏。你别小看这个“密度”,这意味着同样的电费,它能干更多活。 ## 影响 金刚GC3不追求什么都干,就专注视频场景,比如AIGC视频生成、智慧城市、工业质检。这给国产芯片指出了一条新路:与其在通用赛道上追着英伟达跑,不如在视频这样的深水区做出自己的特色。这是从“跟跑”到“场景定义”的转变,也是RISC-V高端算力商业化提速的信号。

视频 riscv ai-chip dataflow
雷锋网 65 分

蚂蚁集团4篇IJCAI论文,核心就一件事:让AI学会随机应变

蚂蚁集团又有4篇论文被AI顶会IJCAI 2026收录。这批论文不拼参数和算力,而是盯住一个更现实的问题:AI太死板,一到真实世界就容易“水土不服”。蚂蚁的做法是让算法学会自己调整——分析用户行为时不用提前定好分成几类,遇到新环境时自动决定该记多少旧经验,做复杂调优时自己找省力路径,连视频好看不好看也能交给AI来打分。论文里的方法在多个标准测试里基本都拿到最好成绩,重点不是刷榜,而是让AI在不停变化的环境里也能稳定干活

点击打开视频 查看视频来源
展开阅读

## 背景:为什么模型“能打榜”不代表“能落地” 实验室里的AI模型指标很漂亮,但一放进真实世界就会掉链子,因为真实世界一直在变。蚂蚁集团的业务尤其典型:超10亿用户、8000多种服务,支付高峰和低谷的数据量能差出几个数量级;风控模型要按小时应对黑产策略变化;全球化部署还要适配不同国家的金融系统。静态模型等于“刻舟求剑”,这也是蚂蚁这批论文要解决的核心问题。 ## 四篇论文,同一套解法:让AI自己调整 具体到方法上,四篇论文各有侧重: - MSRGC-Net:处理时间序列聚类,也就是把大量行为数据自动归类。过去的方法要么算得慢,要么太依赖人工设计;它用一套无需训练的多尺度储备池编码和“颗粒球”结构,按数据密度自动分类,不需要提前指定分成几类。5个基准、15项指标里,它拿了12项第一、2项第二,复杂度接近线性,又快又省。 - ROAD:解决AI从旧数据切换到新环境时的“失忆”问题。它不是固定用多少旧数据、多少新数据,而是通过算法实时调整比例,发现要忘就多回忆旧经验,探索不够就多试新路子。在24个标准任务里,PEX+ROAD有18个排第一,平均分71.12。 - DSEBO:让高维参数调优不再需要专家“拍脑袋”。它先在一个低维空间快速找大致方向,先看轮廓再抠细节,收敛后再自动扩展到高维。在1000维合成任务和多个真实任务上,都优于十几种主流方法。 - VGA-BenchV2:这是视频审美评估基准的升级版。新增3.6万条人工标注,并引入大模型做评估;更关键的是把评估器当成奖励信号,直接去微调生成模型,形成从打分到优化的闭环。 ## 影响:从“做论文”到真正落地 四篇论文分别来自无监督学习、强化学习、黑盒优化和多模态评估四条路线,但方向一致:AI的范式正在从静态走向动态。蚂蚁一边在金融场景里用这些能力提升风控、推荐和调优效率,一边在数字生活、内容生态里布局视频理解与评估能力。因为这些研究本身长在真实业务里,问题来自业务,数据来自业务,效果也在业务里检验。给行业释放的信号是:工业界的AI研究,不是为了发论文而发论文,而是要找到能扛住动态变化的解法

视频 ant-group ijcai-2026 adaptive-ai
雷锋网 72 分

张磊:不以动作为输入条件,就不叫世界模型

视启未来创始人张磊给火爆的世界模型赛道泼了盆冷水:真正的世界模型必须能回答“如果我做了这个动作,环境会怎么变”。他的标准很简单——不以动作为输入条件,就不叫世界模型。按这个标准,像Sora这样只会生成逼真视频的模型,不算世界模型。这个说法给混乱的赛道立了个清晰标杆:投资人可以用它筛选项目,创业者也能对照自己的技术路线是否跑偏。记住这四个字:动作条件,这是判断真假世界模型的核心。

点击打开视频 查看视频来源
展开阅读

## 背景 2026年上半年,中国AI圈最热的就是“世界模型”。公开数据显示,光前六个月国内相关赛道融资就接近300亿元,算上“具身智能+世界模型”甚至超过900亿,比去年同期涨了5倍多。但钱越多,概念越乱:有人把视频生成叫世界模型,有人把3D建模叫世界模型,连LeCun的JEPA也说自己是世界模型。在所有人都急着找答案的时候,IDEA研究院讲席科学家、视启未来创始人张磊给出了一个清晰到近乎苛刻的定义。 ## 关键观点 张磊的核心判断是:世界模型必须有“动作条件”。也就是说,模型必须能回答“如果我做了这个动作,环境会变成什么样”,而不是只会生成一段好看的视频。按照这个标准,Sora这类纯视频生成模型根本不算世界模型,因为它只预测像素变化,不建模机器人和环境的交互。张磊还解释了为什么机器人需要世界模型:真实世界里试错太贵,洗碗可能打碎一万个碗,自动驾驶也不能真的撞车,所以需要一个虚拟训练场,让机器人在脑子里先推演所有的后果。在技术路线上,他支持LeCun的隐空间路线,但认为要在隐空间里引入“物体结构”——这恰好是他们团队之前做DINO-X积累下的看家本领。 ## 影响 张磊的表态给狂热的赛道泼了一盆冷水,也提供了一个让投资人和从业者都能对表的标尺。这轮争论直接影响几十亿资金往哪投。如果他的定义被采纳,很多顶着“世界模型”名头的项目可能都得重新讲自己的故事。对普通人的意义是:未来机器人是否真的能安全、可靠地走进家庭,取决于它是在“脑补”物理规律,还是只会播放动画。张磊说,动作条件是分水岭,越早认清这一点,行业就越少走弯路。

视频 world model embodied AI LeCun
雷锋网 67 分

华为四篇顶会论文:AI别只拼规模了,会“省着用”才是新方向

华为在 IJCAI 2026 上有四篇论文被收录,方向都指向同一个变化:AI竞赛正从“拼规模”转向“拼设计”。这四篇论文分别把层次化视觉模型参数上限推高到300亿、让视频大模型学会“挑着看画面”、把模型适配压缩成定点编辑、还用更聪明的分工方式解决了语码转换语音翻译数据不够的问题。它们都主打少花算力、多出效果,不再硬堆显卡和参数。这篇盘点想说明的是:AI下半场更看能不能把系统设计做细,而不是单纯拼规模。如果这条路走通,未来AI的使用成本会更低、落地也会更快。

点击打开视频 查看视频来源
展开阅读

## 背景 IJCAI-ECAI 2026 还没开幕,但华为这次被收录的四篇论文已经透露出明确风向:AI技术竞赛正在从“拼规模”转向“拼设计”。原因是算力成本居高不下,继续堆参数带来的收益越来越不值;与其总想“能不能更大”,不如想“能不能用得更省”。四篇论文分别来自华为基础研究、AI数据、云服务和翻译服务中心,效率优先不是个别团队的偏好,已经写进了多个环节的技术选择里。 ## 细节 论文一是把层次化视觉Transformer的规模上限从不到2B推到30B。团队重新设计出Efficient Hierarchical ViT架构,再用两阶段训练:先在ImageNet-21K做自监督预训练,再用2700万图像数据做知识蒸馏。总参数30B的MoE模型推理时只激活67亿参数,以89.0%的ImageNet-1K准确率超过普通ViT路线下总参数更大的EVA-CLIP-18B,视频分析和密集预测也表现更好。 论文二解决视频大模型“乱看视频”的浪费问题。现有模型大多均匀抽帧,容易漏掉关键事件,又不断编码静态画面。华为AI数据团队提出可学习帧选择器LFS,让模型自己学会挑重要帧,还用人工标注的中国非遗烹饪场景数据建了新基准ICH-CC;LFS在不同模型和基准上都带来稳定提升。 论文三面向跨任务泛化。常见per-token动态路由很耗显存和计算;华为云等团队提出的RaMod框架,把模型适配变成对关键隐藏表征做定点编辑,再用异步调度器按需分配和释放显存。实验里额外预填时间减少83%,显存占用少79%,跨任务效果也有提升。 论文四处理语码转换语音翻译数据稀缺的问题。华为翻译服务中心联合高校,用MoE语音投影器给每种语言配“专家”,并设计四阶段渐进式训练:先用充足的ASR和ST数据打好基础,再迁移到稀缺的CS数据;在Fisher和NTUML2021测试集上超过SeamlessM4T等强基线,BLEU最高39.52,COMET最高81.33。 ## 影响 这四篇论文的共同点是:不靠堆更多芯片和算力,而是靠更聪明的架构、筛选和训练策略。它不是说“规模不重要”,而是说模型骨架、数据入口、适配方式和训练流程都可以更精细。这预示AI行业可能正走到一个拐点:下一阶段竞争不再只看参数和算力,还要看谁更能理解现实问题、把系统做扎实。对普通用户来说,最直接的可能就是AI服务更便宜、更快、更好落地。

视频 huawei ijcai-2026 efficient-ai
B站 量子位 70 分

100米还是110米?卡尔曼滤波:这不是选择题

汽车进入隧道为什么还能继续导航?飞船如何在茫茫宇宙找准自己的位置?这两个看似无关的东西,背后都用到了一个同样的算法——卡尔曼滤波。

打开视频来源
展开阅读

汽车进入隧道为什么还能继续导航?飞船如何在茫茫宇宙找准自己的位置?这两个看似无关的东西,背后都用到了一个同样的算法——卡尔曼滤波。

视频 video bilibili B站 量子位
IT之家 54 分

苏泊尔承认AI擦边广告审核有漏洞,已全部下架

苏泊尔最近用AI生成了一批短视频广告,里面有一些“女生洗澡时大叔进来”之类的擦边剧情,被网友骂惨了。事件发酵后,苏泊尔紧急下架视频并承认在店铺内容管理和审核机制上存在疏漏。这件事说明,AI内容生成虽然能提升效率,但必须管好边界,否则很容易翻车。苏泊尔此前还说过要推动AI在营销中的应用,现在看,技术再先进,也得先过审核关

点击打开视频 查看视频来源
展开阅读

## 背景 苏泊尔是中国知名的家电品牌,最近在官方账号上发布了一系列用AI生成的短视频广告。其中一些内容引发争议,比如“女生洗澡时搓澡大叔进来”“女生上厕所时保洁大叔进来打扫”这些剧情,明显带有擦边意味。网友看到后非常反感,事件迅速发酵。 ## 细节 面对批评,苏泊尔回应称,发现问题当天就下架了所有涉事视频,并全面复查了视频物料的审核流程。苏泊尔还承认,这次事情反映出公司在授权店铺的内容管理和发布审核机制上存在疏漏。另据苏泊尔2025年财报,公司原本计划推动AI在图文、短视频和直播等领域的测试应用,以提高营销效率。这次事件等于给这个计划踩了一脚刹车。 ## 影响 这件事给所有想用AI做营销的企业提了个醒:AI生成内容能降低成本,但如果审核跟不上,很容易翻车。品牌方不能因为用了AI就放松把关,AI生成的广告必须和传统广告一样经过严格审核。否则,下次再出类似丑闻,损失可能更大。对苏泊尔来说,如何平衡AI效率和内容安全,是接下来必须解决的问题。

视频 ai advertising supor