NVIDIA推出NVCRE:AI工作负载上线前的集群就绪验证工具
NVIDIA发布开源Kubernetes控制器NVCRE,可在AI工作负载上线前通过真实分布式任务验证GPU集群就绪性,自动定位故障节点,支持自适应故障隔离与NCCL、NeMo等多类测试。
NVIDIA发布开源Kubernetes控制器NVCRE,可在AI工作负载上线前通过真实分布式任务验证GPU集群就绪性,自动定位故障节点,支持自适应故障隔离与NCCL、NeMo等多类测试。
NVIDIA推出开源医学AI模型NV-Reason-CT,采用3D视觉Transformer编码器结合Qwen3.5-4B语言模型,可对全身CT进行链式思维推理,生成涵盖60余种异常的结构化报告,并支持多轮对话。模型在C...
NVIDIA 在 ROS 2 Lyrical 中引入 rosidl::Buffer 与 CUDA buffer backend,使节点间可通过零拷贝传输交换 GPU 内存数据。Isaac ROS 5.0 配套 AI 编码...
NVIDIA开源工具Topograph通过发现集群网络拓扑并将其转化为Kubernetes标签、Slurm配置或Slinky ConfigMap,使调度器能够实现拓扑感知的工作负载放置,避免跨域通信瓶颈,提升AI工厂GP...
NVIDIA Confidential Computing结合Blackwell GPU与加密NVLink构建可信推理环境。TensorRT LLM通过CC感知内存选择、异步回读及多GPU通信优化,在8块B200 GPU...
NVIDIA推出DLSS 5,引入3D引导神经渲染技术,已在NBA 2K27率先应用。同步更新NVIDIA ACE语音推理能力,发布RTX Mega Geometry 2.0,支持高密度网格流式连续LOD集群,并将登陆《...
NVIDIA联合Cisco、JFrog、CrowdStrike等合作伙伴,围绕AI Agent全栈安全提出工程化框架,涵盖身份管理、权限边界、沙箱执行与持续红队测试,并开源OpenShell运行时,推动安全防护能力在更广...
NVIDIA Earth-2新增AI数据同化功能,支持将卫星、气象站等多源观测数据融入扩散模型,提供SDA与HealDA两种技术路径,可在秒级内估算全球大气状态,帮助能源、农业、保险等行业实现更高频、更精准的区域或全球天...
NVIDIA在大埃及博物馆举办活动,展示埃及AI生态快速发展成果。过去一年埃及深度学习学员增长逾十倍,非洲已有四座AI工厂宣布或上线,另有656兆瓦产能在建,NVIDIA已在非洲培训逾8.5万名开发者。
本文系统介绍了AI Agent评估体系的演进,阐述了步骤级与端到端两种评分机制的区别,并以SWE-bench和NVIDIA Nemotron 3.5 Lightning为例,说明工具调用已成为现代基准测试的核心基础,建议...
NVIDIA Dynamo-Triton 26.07新增TensorRT多设备推理能力,单个Triton实例可调度最多8块GPU协同执行,以Cosmos 3 Nano视频生成为例,端到端延迟从156.6秒降至34.2秒,...
RTX 5090最低售价已从1999美元涨至逾6000美元,部分渠道报价超9000美元,据称与AI服务器厂商囤货有关,但相关照片被指可能为AI生成,真实性存疑。
NVIDIA介绍多智能体工作流:借助Omniverse Libraries和OpenUSD,将Blender场景自动转化为可用于Isaac Sim/Isaac Lab的仿真就绪世界。
NVIDIA团队开发AI智能体技能,将TileGym中24个cuTile Python/Triton-TileIR内核自动转译为cuTile Rust,性能达原版99.5%,token成本降低约一半。
NVIDIA TensorRT Edge-LLM运行Qwen3.6-27B在MLPerf Edge Agentic基准测试中,于单个Jetson AGX Thor上以24分36秒完成全部1007轮测试,较llama.cp...
费城儿童医院利用NVIDIA开源AI工具,可在数秒内建立儿童心脏三维模型,帮助医生为先天性心脏病患儿定制更精准的手术方案。
NVIDIA推出Groq 3 LPX加速器,通过确定性执行与PEP、CPS技术减少电压裕量,配合Vera Rubin NVL72平台提升每兆瓦token吞吐量,最高较GB200 NVL72提升35倍。
文章解析Dense与MoE两种模型架构差异,以Nemotron 3.5 Lightning为例说明MoE如何用3B激活参数实现30B模型容量,并给出内存、并发、微调等场景选型建议。
Perplexity推出Portable Computer的Windows版本,基于NVIDIA RTX GPU本地运行AI智能体,支持敏感数据本地处理并可按需接入云端模型。
NVIDIA通过Transformer Engine对JAX中的Dropless MoE训练进行分组GEMM、专家并行等优化,使DeepSeek-V3训练性能从103提升至1068 TFLOPS/GPU,1024 GPU...