Skip to content
sealionkingPublic

About

PixelPX — 从光变化中涌现 3D 结构的图片生成模型

Resources

Stars

0 stars

Watchers

0 watching

Forks

Latest commit

 

History

2 Commits

Folders and files

NameName
Last commit message
Last commit date
 
 
 
 

Repository files navigation

PixelPX

pixel professional generative X —— 从光变化中涌现 3D 结构的图片生成模型


这是什么?

一句话:我们不搞 Text-to-Image,我们搞 Image-to-Image。

T2I 的毛病在于,每张训练图都得靠"文本描述"才能被模型理解。描述本身就是瓶颈——你描述得再精确,也是用语言去干几何该干的活。就像让音乐去描述颜色,跨域映射,必然失真。

PixelPX 的思路是:图片是静态的视频,视频里有 3D 和时间信息。用视频训练出 3D 理解,再"啪的一下"降维压缩成 2D 图。

没有物理引擎。现在的视频模型也不是物理引擎,它们只是二维模拟的 3D 和时间数据。我们不可能设计出物理引擎。3D 一致性是靠几何约束从数据里学出来的,不是算出来的。


起源故事

本来是喷李飞飞 World Labs 所谓"世界模型"的口水,喷着喷着突然发现——我要做的生图模型,竟然就是她们在做的世界模型。大水冲了龙王庙,小丑竟是我自己。

但凭我们的脾气,也是不能认的。李飞飞的路子要天量算力,我们偏不信这个邪。从昨晚干到今晚,搞出来了一个 1.1M 参数的验证版,30 张凭空生成的图片,跑通了从训练到生成的全流程。

详细的故事和我当时的思考过程,写在公众号里了:

喷着口水搞出来的 PixelPX —— 一个低算力世界模型的诞生


技术白皮书

面向公众的技术方向公开文档,包含完整的算法理念、架构设计和预训练成果:

PixelPX 技术白皮书 v1.0

白皮书里讲了:

  • T2I 的描述瓶颈为什么是打补丁而不是治本
  • 四条第一性原理(图片=静态视频、用视频训练、结构预测而非像素生成、无物理引擎)
  • 核心创新:从光变化中涌现 3D(自然力做物理,我们只学光场)
  • 技术体系:PXFormer、GeoTriangle、GXI、PXLoop 等自有架构
  • 生成管线:text2sample-image2FINALIMAGE 三段式
  • 预训练成果:Step 1-6 完整数据链

预训练成果

1.1M 参数的小模型,在一张 RTX 3050 Laptop(4GB 显存)上跑的,别嫌小——这是架构验证,不是产品。

Step 干了什么 关键指标 过没过
Step 1 合成数据最小验证 L1=0.040 ✅
Step 2 3D 原点场 + 几何不变性 Z 相关 0.9997 ✅
Step 3 真实牧场单场景 L1=0.035 ✅
Step 4 多场景灰度(5 场景) L1=0.058 ✅
Step 5 RGB 彩色(5 场景) L1=0.067,光场捕获色温 ✅
14 机位 SkyFinder 联合训练 L1=0.0313,插时刻比值 1.02 ✅
Step 6 BERT 式 Mask 补全 补全/重建比值 0.86 ✅
image-gen 凭空生成 30 张图 多样性 2.75 ✅

命门指标是插时刻 L1 ≈ 重建 L1——意思是模型不是死记像素,是真学到了 3D 结构和光场规律,能预测没见过的中间帧。14 机位训练的比值是 1.02,接近完美。


核心理念

视频 = 训练数据(学光影关系)
  ↓ 降维打击
图片 = 应用产品(补全/生成)

三种生成模式:

  • image-gen(凭空生成):啥也不给,直接抽卡
  • Completion(补全):给半张图,补成整张
  • Transformation(变换):给整张图 + 换个光场,出不同时刻的图

和别人的区别

维度 T2I 扩散 伪世界模型视频 3D 世界生成派 PixelPX
3D 表征 无 无显式 渲染基元 3D 原点场
物理引擎 无 伪物理(外挂损失) 无 无(几何先验学出来)
训练数据 图文对 海量视频 配对 (image, 3D) 单视频自监督
caption 瓶颈 有 有 无 无
数据成本 中 低 极高 极低

算力可以买,数据买不到。 3D 世界生成派的命门是 3D 数据稀缺。我们用单视频自监督,视频帧本身就是真值,数据无限,只愁算力。


历史验证

这不是空中楼阁——400 年的古典画家就是这么干的。

维米尔画《倒牛奶的女仆》,坐几小时,太阳从东窗移到西窗,阴影一直在变。他从"阴影怎么变"推断出"桌面是平的、罐子是圆的"。他就是从光变化学 3D,然后落笔画的是"理解了完整光场之后的一个时刻"。

画家做了 400 年,我们只是把画家的脑子换成 PXFormer + GXI。方法论同构,工具升级。


下一步

  • 扩规模到 100 场景,接入完整算子
  • PXscore 打分体系(每 patch 的 3D 置信度)
  • 完整 GXI 等变模块 + PXLoop 循环精化
  • image-gen 质量提升 + 扩散精化器接入

知识产权

具体算子实现、训练细节和架构参数属于商业机密,公开文档不予披露。

如有私有化模型训练和后训练需求,可聘请我们做训模工程队。


PixelPX:从光变化中涌现 3D 结构。

About

PixelPX — 从光变化中涌现 3D 结构的图片生成模型

Resources

Stars

0 stars

Watchers

0 watching

Forks

Releases

Packages

Contributors