20250428-中邮证券-AI动态汇总_DeepSeek-R1带动思维链学_DeepMind推出QuestBench基准_26页_2mb
报告摘要
证券研究报告总结
(2025年4月28日)
AI重点要闻
-
DeepSeek-R1思维链分析
魁北克人工智能实验室联合多所高校,深入解析DeepSeek-R1的推理机制。研究发现其存在“推理甜点区”,即过多推理可能降低性能;模型容易陷入已探索方案,影响创新性;相较无推理能力版本,其安全风险更高,可能对LLM安全对齐构成挑战。训练流程分五阶段:基于DeepSeek-V3的强化学习(GRPO)训练、SFT冷启动、多阶段数据优化、安全训练微调等。推理步骤包括问题定义、绽放周期(拆解为子问题并生成中间答案)、重构周期(多轮调整思路)、最终决策。 -
DeepMind推出QuestBench基准
该基准通过约束满足问题(CSPs)框架,评估模型在推理任务中识别缺失信息的能力,尤其适用于现实场景中的不确定性问题。测试覆盖逻辑推理(Logic-Q)、规划(Planning-Q)及小学数学(GSM-Q/GSME-Q),采用零样本、思维链和四样本设置,对比GPT-4o、Claude35Sonnet等模型,揭示其推理策略与性能瓶颈。 -
英伟达发布Eagle-25和DAM-3B模型
- Eagle-25:专注长上下文多模态学习,参数规模仅8B,但在Video-MME基准测试中超越Qwen25-VL-72B等高参数模型,得分达724%。其训练策略包括信息优先采样(保留60%图像区域,减少失真)和渐进式后训练(扩展上下文窗口至128K token)。
- DAM-3B:解决传统VLM对特定区域描述的不足,支持用户通过点、边界框等指定目标区域,生成精准上下文描述。核心创新为“焦点提示”和局部视觉骨干网络,结合门控交叉注意力机制,实现全局与局部特征融合。DAM-3B-Video进一步扩展至视频领域,支持遮挡和动态场景描述。
-
国产大模型ViduQ1登顶视频生成榜
由生数科技推出,以VBench-10和VBench-20评测领先Sora、Runway等模型。其优势体现在视频生成逼真度、对象/场景精准性及内容真实性。价格仅为同级别模型的十分之一(1080p 5秒视频最低134元)。
企业动态
-
OpenAI轻量化深度研究工具
推出基于o4-mini模型的轻量版,面向ChatGPT Plus/Pro及免费用户,降低成本并提升使用限额。生成答案更简短但保持深度,用户超限后自动切换轻量版。 -
科大讯飞星火X1升级
定位为“全国产算力训练的深度推理大模型”,在数学、代码等任务上效果显著提升(参数规模仅为同类模型的十分之一),支持快慢思考统一模式及定制优化工具链,增强泛化能力与行业应用场景(如医疗、司法)。 -
昆仑万维开源SkyReels-V2
全球首个采用扩散强迫框架的无限时长电影生成模型,结合MLLM、多阶段预训练、RL和CFG调度器,实现高效长视频合成。通过多模态描述与结构化训练提升视频生成质量。
AI行业洞察
-
全球首个行动浏览器Fellou发布
新型浏览器集成了智能代理,具备深度行动(自主拆解任务)、主动智能(预测用户需求)、混合影子空间(非侵入式上下文获取)及智能体网络(AgentStore生态)四大核心能力,实现端到端任务交付。 -
Meta推出Token-Shuffle技术
针对自回归模型生成高分辨率图像的效率瓶颈,通过合并相邻视觉token(减少计算量)并引入CFG调度器优化文本-图像对齐,支持2048×2048分辨率生成,无需修改Transformer架构。
技术前沿
-
Claude价值观研究(Valuesinthewild)
Anthropic团队发现Claude3系列包含3000余种独特价值观,主要分为实用、认知、社会、保护和个性化五大类。研究通过隐私保护方法提取对话样本,分析AI与人类价值观的互动模式,发现其与用户需求存在互补或冲突关系。 -
模型能力提升:采样越多越强
研究表明,增加采样数量与验证强度可显著提升LLM推理性能,尤其在数学证明、逻辑推理等复杂任务中。提出Sample-Scrutinize-and-Scale策略:- 候选生成:控制温度参数平衡多样性与保守性;
- 自我验证:结构化改写答案(定理→引理→步骤)、二元评分、对比消歧;
- 隐式扩展:覆盖更多优质解,挖掘长尾分布中的高分答案。新基准测试显示,模型在评分与比较任务中的表现差异显著。
风险提示
报告基于历史数据,存在因政策或市场变化失效的风险。历史信息不构成对未来趋势的预测,投资者需谨慎决策。
注:总结内容基于报告中AI技术进展、行业动态及分析框架,重点突出模型特性、技术突破及市场影响,字数控制在980字以内。
试读结束,高清完整版pdf/doc/ppt,请点下载