Lightweight dense video captioning with cross-modal attention and knowledge-enhanced unbiased scene graph
{{output}}
Dense video captioning (DVC) aims at generating description for each scene in a video. Despite attractive progress for this task, previous works usually only concentrate on exploiting visual features while neglecting audio information in the video, resulting i... ...