我想用一句话生成图片和视频,该怎么说?

一句话按'谁在干什么、什么样'排:哪家放最前面,动作跟住哪家,风格收尾——顺序对了,短话也出好图。形容词精选不堆砌——一个具体的('黄昏光线')胜过五个笼统的('很美很壮观')。

一句话的结构。生成工具读句子,最看重开头——把主角放句首:'一条红龙鱼……'比'黄昏的水草缸里有一条……'更不容易跑题(后一种常生成一缸水草没鱼)。动作跟住主体:'……在水面游动',画面立刻有了动态;没有动作的('一条红龙鱼的特写')也行,出的是静帧。风格收尾:'……水墨风格''……写实摄影'——最后的定性词决定整体气质。

形容词的用法——少而具体。笼统词生成器读不出画面:'很漂亮''超级震撼''高质量'——删掉不损失信息。管用的形容词有画面感:光线(黄昏光、逆光、顶光)、镜头(特写、俯视、微距)、质感(鳞片反光、水面波纹)。一句话里这类词放一两个——多了互相打架,工具不知道听谁的。拿不准哪个词起作用,同一句话删掉它生成两次,一对比就知道。

不满意的修法——改词,别整句重写。生成结果偏了,定位是哪个词带偏的:颜色不对改颜色词、构图不对改镜头词、气质不对改风格词——一次只动一个地方,改完再生成,因果清清楚楚。整句重写的问题是:变量全变了,好了也不知道为什么好,坏了不知道为什么坏。视频多一层的讲究:动作写'连续可发生的'('缓慢游动'出得来,'突然瞬移'出不来),一句话里给视频留一个连贯动作就够。

延伸几个常见问题

中英文描述,生成效果差很多吗?

多数工具英文底子厚,中文能用的在变多。英文描述的词库和对应关系训练得多——同一意思用英文写出,细节命中率常高一点;中文不是不能写——主流工具都支持,但生僻词、成语直译过去容易失真。实用的做法:先用中文写顺,试两次不满意就翻译成英文再试——两次的结果摆一起,哪个好用用哪个,别在一种语言里死磕。

为什么每次生成都不一样?

这是设计如此,不是故障。生成模型每次从随机起点出发——同一句话出十个版本,各有各的解。用法上顺势而为:挑的思维用——生成三四张,挑最接近的继续改话再生成,几轮收敛到你要的;一次就指望命中的思维费劲——话写得再细也有随机性。改话的收益在'平均质量',多生成几轮的收益在'挑到好的'——两头都做,出图又快又准。

一句话写多长合适?

一句到两句,三十词上下。太短('一条鱼')——随机性占大头,出什么看运气;太长(七八十个词的长句)——词之间互相稀释,重点反而抓不准。甜点区在'主体加动作加一两个定性词'——三十词内说完。真有很细的要求,宁可拆成两轮:先出大样,再对着大样提修改——比一句话塞满所有要求有效。