13:27·MarkTechPost(RSS)·关联 2 源
Contrastive-LM发布CLM-8B,这是首个对比语言模型(CLM)类别的开源模型。与生成文本不同,该模型用于对候选动作进行评分并返回概率,旨在对标TypeSafe AI的专有System One模型Jev。其架构基于冻结的Qwen3-8B骨干网络加上20M参数的可训练投影头,采用双向InfoNCE损失进行训练。在零样本测试中,CLM-8B在T-Rex游戏等任务上速度比Jev快9倍,且能部署于单张NVIDIA GPU。微调后的版本在DeepSWE和Terminal-Bench 2.1基准上展现出优于Jeb的验证能力,为Agent循环提供了低延迟的状态-动作匹配方案。
#Contrastive-LM#CLM-8B#Agent
08:34·Hacker News Best(web_list)
drivingbench.com 展示了多个模型在自动驾驶模拟环境中的性能对比。GPT-6 Astra(使用 Codex medium)在三次尝试中取得了最佳进展,其中第二次尝试以5分22秒完成全程,进度达到100%。相比之下,Claude Fable 5.1、Grok 4.6 和 GPT-5.6 Sol 均未完成全程,最佳进度分别为45%、11%和6%。该榜单记录了各模型的尝试次数、行驶距离、耗时、命令调用数及Token成本等详细数据,直观反映了不同模型在复杂驾驶任务中的能力差异与效率。
#drivingbench#GPT-6 Astra#Benchmark
11:35·Rohan Paul·关联 3 源
Google DeepMind负责人Koray Kavukcuoglu向The Information透露,下一代大模型Gemini 4目前已进入后训练(post-training)阶段,即将发布。他计划在今年年底前更早地推出一个早期后训练版本,并在此基础上进行快速迭代。该消息确认了Gemini 4的研发进度已进入收尾阶段,但尚未公布具体的发布日期、技术细节或性能基准数据。
#Google DeepMind#Gemini 4#模型进展
22:17·量子位(RSS)
DeepSeek通过内核补齐与通信重构技术,显著提升了基于PCIe显卡的推理性能。实测数据显示,1.5台搭载6000D显卡的设备在推理吞吐量上超越了单台B300设备。该成果展示了在非原生互联架构下,通过软件层面的优化挖掘硬件潜力的可行性,为降低AI推理成本提供了新的工程路径。
#DeepSeek#推理优化#PCIe
22:00·NVIDIA 博客(RSS)
NVIDIA加入由Google DeepMind、EMBL-EBI等组成的全球研究联盟,通过AlphaFold Database公开超过2800种病毒的蛋白质复合物3D预测结构。该数据集利用AlphaFold2模型及NVIDIA BioNeMo推理运行时生成,旨在加速未来大流行病的疫苗与药物研发。约30%的蛋白相互作用为科学界首次发现。同时,NVIDIA开源了BioNeMo结构预测流水线,供研究人员将蛋白质序列转化为预测的3D结构。此举被视为应对潜在新发传染病的重要知识储备。
#NVIDIA#Google DeepMind#AlphaFold
13:22·IT之家(RSS)
9月24日,阿里达摩院联合四川省肿瘤医院等机构发布食管癌筛查AI模型DAMO EAGLE。该模型无需插管和造影,仅凭胸部平扫CT即可识别早期及癌前恶性病变,已在3个国家8万多病例上获得验证。相关论文于9月22日发表于《自然·医学》。在机会性筛查场景下,模型对食管癌的敏感性达90%,对癌前病变敏感性为52.5%,特异性高达99.2%。达摩院算法专家姚佳文介绍,团队通过将内镜报告与增强CT病灶位置配对到平扫CT上进行训练。目前达摩院已跑通“平扫CT+AI”技术路线,有望通过一次检查筛查多种高发癌症。
#阿里达摩院#医疗AI#食管癌
00:32·r/LocalLLaMA(Reddit)
UkisAI发布基于Qwen的Swift高效推理LLM家族,通过惩罚病态过度思考模式并结合RL与OPD技术训练。包含Swift1.5 27B、Flash Next和Bonsai 2三个版本。Swift1.5 27B思考Token减少58.5%,Terminal Bench 2.1得分略高于基座;Flash Next减少63.4%思考Token,速度提升1.8倍;Bonsai 2减少39.8%思考Token。提供GGUF、NVFP4等量化格式及Research API。另有9B变体即将推出。
#UkisAI#模型发布#Swift