DeepSeek V4采用稀疏注意力机制,在百万token上下文场景中将推理成本降低73%。但NIST政府评估发现其在跨领域推理能力上仍落后美国前沿模型约8个月,显示中国AI模型在效率上领先但在综合能力上仍有差距。据Tech Times于6月20日报道。
来源:Tech Times
DeepSeek V4采用稀疏注意力机制,在百万token上下文场景中将推理成本降低73%。但NIST政府评估发现其在跨领域推理能力上仍落后美国前沿模型约8个月,显示中国AI模型在效率上领先但在综合能力上仍有差距。据Tech Times于6月20日报道。
https://www.techtimes.com/articles/318725/20260619/deepseek-v4-architecture-how-sparse-attention-cuts-inference-costs-what-nist-found.htm
评论
0