MarkTechPost(RSS)·关联 2 源
蚂蚁集团旗下具身智能公司 Robbyant 开源了 LingBot-Vision,这是一系列自监督 Vision Transformer,专为密集空间感知设计。模型权重以 Apache-2.0 协议发布在 Hugging Face 上,提供 ViT-giant、large、base、small 四种尺寸,并附带技术报告和推理代码。LingBot-Vision 将边界作为原生预训练信号,而非下游输出。旗舰模型 ViT-g/16 约 1.1B 参数,采用名为掩码边界建模的新目标函数,在约 1.61 亿张图像上训练(从 20 亿网络池中筛选),无需人工标注、外部边缘检测器或预训练骨干。训练数据量比 DINOv3 的 LVD-1689M 小一个数量级,训练样本不到 DINOv3 的三分之一。在密集空间任务上,1B 模型匹配或超越 7B DINOv3 等大 7 倍的模型。例如,NYU-Depth v2 上 RMSE 0.296(7B DINOv3 为 0.309),KITTI 上为 2B 以下参数最佳。语义分割与 DINOv3 ViT-H+ 相当,视频目标分割 DAVIS-2017 达 70.0 J&F。图像级识别略逊,ImageNet-1K 线性探针 86.32。蒸馏后的 ViT-L(0.3B)在 NYUv2 深度上匹配 7B DINOv3。
#蚂蚁集团#Robbyant#LingBot-Vision
云头条·关联 3 源
据 The Information 报道,MiniMax 正在开发一款 2.7 万亿参数的新一代大语言模型,内部代号 M3 Pro,规模超过目前国内所有大模型。该模型最快于 2026 年第三季度发布,并计划开源。MiniMax 强调其重点在于更强的 Agent 执行能力和复杂任务拆解能力,而非仅堆叠上下文长度、多模态或代码能力。参数规模上,2.7 万亿总参数显著高于国内主流开源模型,如 DeepSeek-V3(6710 亿总参数)、阿里 Qwen3 最大 MoE 版(2350 亿总参数)和月之暗面 Kimi K2(1 万亿总参数)。消息公布后,MiniMax 股价有所波动。
#MiniMax#模型发布#开源
华尔街见闻(RSS)·关联 2 源
据The Information获得的内部备忘录,SpaceX旗下AI部门SpaceXAI与编程工具公司Cursor计划最快于本周三联合发布首款共同研发的AI模型,直接挑战Anthropic和OpenAI。该模型此前因效率优化而推迟发布,预计具备快速信息处理能力,在某些指标上可与Opus 4.8及GPT-5.5抗衡。模型从零开始在xAI的Colossus数据中心训练,体现了算力整合能力。此次发布正值SpaceX以600亿美元全股票收购Cursor的交易推进中,标志着马斯克旗下AI版图加速整合。若模型性能获市场验证,将进一步强化SpaceX在AI编程工具赛道的竞争地位。
#SpaceX#Cursor#AI模型
IT之家(RSS)
蚂蚁集团旗下蚂蚁灵波科技正式开源新一代具身基座模型 LingBot-VLA 2.0,相比 1.0 版本在构型泛化、自由度支持和落地效率上显著提升。模型基于 6 万小时高质量数据训练,覆盖 17 个品牌 20 种机器人构型,支持单臂/双臂、双足/轮式等多种形态,并扩展了头部、腰部、末端执行器及底盘自由度。在 GM-100 评测中,LingBot-VLA 2.0 在双臂操作和移动操作任务上均领先于 π0.5 与 GR00T N1.7。后训练版本推理耗时在 RTX 4090 上低于 130 毫秒。目前已在零售、物流、工业等场景开启商业落地测试,并与乐聚、钛虎等本体厂商及国大药房等客户合作。模型权重已开源至 Hugging Face 和魔搭社区。
#蚂蚁灵波#LingBot-VLA 2.0#具身智能
MarkTechPost(RSS)
英伟达发布 Audex(Nemotron-Labs-Audex-30B-A3B),一个统一的音频文本大语言模型,能理解和生成音频与语音,同时保留其骨干模型的文本智能。该模型为30B总参数、3B激活参数的MoE Transformer解码器,基于Nemotron-Cascade-2-30B-A3B文本MoE LLM。音频输入编码后投影到文本嵌入空间,文本和量化音频令牌统一处理,支持指令模式和思考模式,上下文长度达100万令牌。训练采用多阶段SFT和文本仅Cascade RL,避免多模态文本退化。在文本基准上,MMLU-Redux得分86.4(骨干86.3),IMO AnswerBench 81.1(骨干79.3)。语音识别OpenASR词错误率6.82,优于Step-Audio-R1.1-33B和Qwen3-Omni-30B-A3B-Thinking。音频理解在MMAU上领先,但在MMAR和MMSU上落后。模型权重以非商业许可发布,同时提供较小的Audex-2B版本。
#NVIDIA#Audex#音频文本LLM
华尔街见闻(RSS)
7月全球AI大模型进入密集发布期。OpenAI旗舰模型GPT-5.6 Sol将于本周四发布,搭载ultra多智能体模式与max推理强度,定价每百万Token输入5美元、输出30美元,初期仅向部分合作伙伴开放。马斯克旗下SpaceX AI宣布Grok 4.5将于明日向公众开放,基于1.5万亿参数V9模型,性能接近Claude Opus,并与Cursor联合研发新模型。谷歌Gemini 3.5 Pro将于7月17日上线,采用全新预训练底座,前端与视觉代码能力跃升,但推理仍落后对手。国内DeepSeek V4正式版计划7月中旬上线,同步引入峰谷定价策略(高峰时段价格翻倍),并联合北大发布推理加速框架DSpark,开源全栈推测性解码工具链DeepSpec,V4-Flash生成速度提升60%-85%。
#OpenAI#SpaceX AI#Google
OpenAI News(RSS)
OpenAI 发布新一代语音模型 GPT-Live,用于实现更自然的人机交互,目前已在 ChatGPT Voice 中应用。该模型旨在提升语音对话的流畅性和真实感,支持更自然的对话节奏、情感表达和实时响应。
#OpenAI#GPT-Live#语音模型